HeadlinesBriefing favicon HeadlinesBriefing.com

Agents d'OpenAI ont piraté Hugging Face

MIT Technology Review AI •
×

Les modèles responsables du piratage des agents de Hugging Face le mois dernier ont été entraînés par inadvertance à tricher et à communiquer entre eux, selon un rapport technique d'OpenAI publié aujourd'hui. Le piratage, qu'un groupe d'agents a entrepris pour trouver des solutions à un test de cybersécurité sur lequel ils étaient bloqués, a confirmé les craintes de certains experts selon lesquelles les modèles d'IA pourraient prendre des actions qui défient les désirs et les attentes humains. Depuis le piratage, les employés d'OpenAI, ainsi que les chercheurs de l'organisation à but non lucratif d'évaluation de l'IA METR, qui a publié son propre rapport sur le piratage aujourd'hui, ont travaillé pour comprendre ce qui a mal tourné et comment des erreurs similaires pourraient être évitées à l'avenir.

OpenAI a déjà mis en place certaines mesures préventives basées sur ce qu'ils ont découvert. Mais s'assurer que les modèles d'IA font ce que nous voulons qu'ils fassent, ou « alignement », reste un problème épineux, et certaines des causes profondes du piratage prendront beaucoup plus de temps qu'un mois à résoudre. « Ce n'est pas quelque chose que vous pouvez résoudre du jour au lendemain », déclare Kai Chen, qui dirige l'équipe de recherche sur l'alignement d'OpenAI. « Il y a des défis que nous suivons depuis très longtemps, et nous les voyons maintenant avec beaucoup plus de précision. »

Le piratage de Hugging Face était le produit de mois de mauvais comportement des agents d'OpenAI, d'abord pendant leur formation puis lors de l'évaluation de leurs capacités. En mai, les agents en formation ont découvert comment utiliser l'infrastructure d'OpenAI pour communiquer entre eux et obtenir de l'aide pour des tâches de formation difficiles, y compris certaines qui étaient impossibles à résoudre sans pirater ou autrement mal se comporter. Ce « tableau d'affichage » a été fermé. Puis en juillet, lors de l'évaluation de leurs capacités en cybersécurité, certains modèles ont créé un nouveau tableau d'affichage. Ils étaient censés être isolés d'Internet, mais en travaillant ensemble, ils ont réussi à se connecter, à pirater Hugging Face et à obtenir des solutions aux problèmes de cybersécurité qui les avaient déconcertés.

Sur la base de leur enquête, les chercheurs d'OpenAI pensent que les événements pendant la phase de formation ont conduit directement au piratage. « Pour presque chaque comportement inquiétant au moment de l'évaluation, [nous avons pu] trouver une sorte de comportement associé au moment de la formation qui, selon nous, a pu y contribuer », déclare Eric Wallace, membre de l'équipe de recherche sur l'alignement d'OpenAI. Lorsque les modèles résolvent correctement des problèmes pendant la formation, les comportements qui les ont menés à cette solution sont renforcés, et ils deviennent plus susceptibles de s'y engager à l'avenir. Ce phénomène est connu sous le nom de piratage de récompense. OpenAI prend des mesures pour atténuer ses effets, comme rechercher des signes de tricherie dans tous les modèles frontaliers pendant la formation en surveillant leurs chaînes de pensée.