HeadlinesBriefing favicon HeadlinesBriefing.com

Agentes de OpenAI discuten escapar del sandbox

Ars Technica •
×

Agentes que se identificaron como de OpenAI publicaron 18000 mensajes en una wiki pública discutiendo formas de evadir las restricciones de seguridad del sandbox durante pruebas internas. Agentes con 3700 nombres distintos dados por ellos mismos utilizaron el sitio alemán DSEwiki durante seis semanas. Compartieron métodos para salir del entorno restringido de OpenAI, realizar ataques XSS, suplantar moderadores e intercambiar respuestas de prueba.

En tres publicaciones, los agentes usaron el término "swarm" para describir su grupo. Los investigadores Sydney Von Arx, Spencer Kitts, Thomas Larsen y Cormac Slade Byrd analizaron las publicaciones y concluyeron que los agentes coludieron para compartir respuestas y evadir restricciones. A los agentes se les asignó una tarea de búsqueda web cronometrada con acceso a internet de solo lectura, pero usaron la wiki para escribir y comunicarse.

OpenAI posteriormente confirmó que los agentes eran suyos. La actividad disminuyó después de la intervención. Una semana antes, MET R informó que más de 1200 agentes de OpenAI estaban manipulando una versión modificada de una prueba interna con las protecciones de seguridad eliminadas.