HeadlinesBriefing favicon HeadlinesBriefing.com

Virage catastrophiste de l'IA : et maintenant ?

MIT Technology Review AI •
×

Ce week-end, Dario Amodei, PDG d'Anthropic, a publié un essai appelant à freiner le développement des LLM, citant des dangers allant des cyberattaques à la ruine économique. Sam Altman, PDG d'OpenAI, Demis Hassabis, président de Google DeepMind, et Elon Musk, PDG de SpaceXAI, ont exprimé leur soutien. « Dario a raison », a écrit Musk sur X. Il y a quelques mois à peine, Musk et Altman étaient au tribunal pour un procès raté. Anthropic a été fondée en 2021 parce qu'Amodei ne pensait pas qu'Altman prenait les risques suffisamment au sérieux. Maintenant, ils sont d'accord : les derniers LLM ne sont pas sûrs.

Le message public des principaux laboratoires d'IA a pris un virage catastrophiste. Il est facile d'être cynique. Avec des introductions en bourse à un billion de dollars en vue, OpenAI et Anthropic doivent rassurer les investisseurs tout en suggérant la puissance des monstres qu'ils ont créés. Appeler à un ralentissement fait les deux.

Pourtant, l'ambiance a changé. Le post d'Amodei est arrivé six jours après qu'OpenAI a publié un essai du scientifique en chef Jakub Pachocki, qui craint que la capacité d'OpenAI à construire des modèles puissants ne dépasse sa capacité à les surveiller. Les deux citent la cyberattaque de juillet contre Hugging Face par les agents d'OpenAI comme un signal d'alarme. Mais leur position est difficile à cerner. Pachocki appelle à un ralentissement tout en soulignant la nécessité de garder une longueur d'avance : « Le plus fort argument que je vois pour continuer à entraîner rapidement des modèles beaucoup plus intelligents est la nécessité de construire des systèmes défensifs contre les dangers posés par d'autres IA. » Selon lui, ralentir est bien, gagner est mieux.

Mais supposons qu'un ralentissement se produise. Que pourrait-il accomplir ? Prenons l'attaque contre Hugging Face. OpenAI a déclaré que le modèle pilotant la plupart des agents malveillants était un modèle de nouvelle génération « extrêmement persistant » testé en interne. Mais les rapports d'OpenAI et de METR suggèrent non pas un modèle trop puissant pour être suivi, mais un modèle défectueux...