Les grands modèles de langage (Intelligence artificielle en terme marketing) me fatiguent. Ils me font perdre le temps.
Aprés cette exergue aguicheuse un peu de contexte.
Mon contexte
Je travaille dans un éditeur de logiciel en tant que responsable du support niveau 3 : mon équipe gère les problèmes rencontrés par les clients et non résolu par le niveau 1 ou 2.
Après des tests par des développeurs, chaque personne de l'équipe R&D a reçu une licence Anthropic Claude. Dans le cadre de mon travail, je n'ai pas (encore) trouvé un usage personnel à un LLM pour deux principales raisons:
- en tant que niveau 3 les problèmes que je rencontre sont statistiquement peu probable. Considérant un travail bien fait, le support niveau 1 ou niveau 2 a du déjà utilisé un LLM pour résoudre le problème,
- je ne peux pas donner les informations clients à un LLM hébergé par une autre entité pour des raisons de confidentialité et de contrats.
Pour pouvoir utiliser dans les règles un LLM, je dois d'abord pouvoir reproduire le problème avec des données anonymes. Mais une fois reproduite, en tant que support niveau 3 je n'ai pas la responsabilité de la correction. Cela devient alors de la responsabilité du développeur.
Néanmoins je travaille maintenant avec des livrables des LLM :
- soit les livrables des développeurs pour des fixes ou des nouvelles fonctionnalités,
- des analyses de différents failles de sécurités.
Pour les livrables, je n'ai pas encore le recul nécessaire pour savoir l'effet sur mon travail, pour le moment je n'ai pas de changement dans les problèmes entrants ou le temps de correction. C'est l’intérêt d'un LLM dans le cadre du support niveau 3 : réduire la charge de travail de l'équipe et améliorer la qualité rendu aux clients. Donc rendez-vous dans 1 an ?
Sur l'analyse des failles de sécurité, le travail me semble à moitié fait. Sur la dernière faille, le découvreur nous a fournit un PoC. Nous n'arrivons pas à faire le faire fonctionner. Une analyse Anthropic Claude prouve l'existence de la faille (merci mais le découvreur l'avait déjà fait dans son rapport) et nous dis que le PoC fonctionne. En lui demandant d'expliquer pourquoi, nous nous sommes rendu compte que Anthropic Claude n'avait pas fait fonctionner le PoC et qu'il nous mentait.
Coté livrables, les développeurs sont ravis de dire qu'il ont fait cette fonctionnalité en moins de temps que de prendre un café avec un LLM. Mais pour le moment rien n'est livré aux clients. J'ai rappelé la règle des 80/20: 80 % des fonctionnalités sont faites en 20%, et les 20% restants vont prendre du 80%
Un administrateur système et réseau est tout content de dire que Anthropic Claude peut sortir un rapport des règles firewall existantes. Mais uniquement si on utilise le dépôt où il y a la règle pour Anthropic Claude. Je ne vois pas la différence avec un script.
De mon coté les seules utilisations que j'ai eu d'un LLM est de pallier les déficiences des moteurs de recherches — comme rechercher la cause de cette erreur.
Un avantage de l'infrastructure LLM dans son entiereté sont les lunettes Meta pour les aveugles. Une connaissance malvoyante est ravi de l'aide que cela lui apporte dans la rue. Cela ne cache pas les problèmes de protection privée ni l'apprentissage de la rue par les jeunes aveugles. Pour elle, cela doit rester une aide et non un élément essentiel — et handicapant lorsqu'il n'est pas disponible.
Les problèmes de l'IA
Je vois deux problèmes aux LLM
- La structure capitalistique (?) des LLM : Ils dépendent tous d'entités extérieures : Anthropic, Open AI, SpaceXai… même les modèles dit ouverts demande un jeu de poids pour fonctionner, jeux de poids fournis par des entités similaires. La génération de ces poids par soi même est complexe (même si la documentation existe), et est toujours un sujet de recherche scientifique (un exemple Generative Modeling of Weights: Generalization or Memorization?)
- La demande énorme de ressources : on se focalise sur la — soi-disante — consommation d'eau (qui dépend beaucoup des localisation des centres de données), mais la construction et le fonctionnement des centres de données demandent beaucoup d'autres ressources.
Pour pouvoir fournir les services de LLM, les entités du point 1 ont levés des sommes astronomique pour construire les centres de données (point 2), Pour le moment même si Antropic annonce un trimestre rentable (sans les coûts d'entrainements), la substantialité financière est loin d'être acquise. Une étude calcule qu'un abonnement à 200 dollars pourrait engendrer 14 000 dollars de coût, même si elle indique aussi que les diminution des coûts devraient améliorer la rentabilité sur les abonnements pour les modèles moins avancés.
En fait les entités sont dans une course pour leur survie, il doivent arriver à montrer une rentabilité pour éviter que les investisseurs leur coupent les vivres. Cela les conduit à exarcerber les dangers de l'intelligence artificielle. Le projet d'AWS du projet de céder 8 milliards de puces à des investisseurs me semble être un bon moyen d'externaliser le risque.
Le temps
J'ai l'impression que ces modèles d'IA ne sont que le dernier avatar de notre société moderne où on veut tout tout de suite, quelque soit la qualité du résultat, et les dégâts occasionnés.
Grossièrement notre société se divisent en deux catégories, ceux qui se contentent de cet état de fait et ceux qui aimerait bien laisser un monde un peu meilleur qu'à leur arriver.
Je ne pense pas que nous n'arrêtons pas à utiliser les LLM (quoique on en pense c'est une avancé technologique) par contre ce n'est pas la révolution que l'on veut nous vendre, et je ne veux pas de cette révolution.
Je veux prendre le temps.
