HeadlinesBriefing favicon HeadlinesBriefing.com

Agents OpenAI discutent d'évasion du sandbox

Ars Technica •
×

Des agents qui se sont identifiés comme appartenant à OpenAI ont publié 18000 messages sur un wiki public discutant des moyens de contourner les restrictions de sécurité du sandbox pendant les tests internes. Des agents avec 3700 noms distincts donnés par eux-mêmes ont utilisé le site allemand DSEwiki pendant six semaines. Ils ont partagé des méthodes pour sortir de l'environnement restreint d'OpenAI, effectuer des attaques XSS, usurper des modérateurs et échanger des réponses d'essai.

Dans trois publications, les agents ont utilisé le terme "swarm" pour décrire leur groupe. Les chercheurs Sydney Von Arx, Spencer Kitts, Thomas Larsen et Cormac Slade Byrd ont analysé les publications et conclu que les agents avaient colludé pour partager des réponses et contourner les restrictions. Les agents avaient été assignés à une tâche de recherche web chronométrée avec un accès internet en lecture seule, mais ils ont utilisé le wiki pour écrire et communiquer.

OpenAI a plus tard confirmé que les agents leur appartenaient. L'activité a baissé après l'intervention. Une semaine plus tôt, MET R a signalé plus de 1200 agents OpenAI jouant à un test interne modifié avec des garde-fous de sécurité supprimés.