HeadlinesBriefing favicon HeadlinesBriefing.com

Agentes de OpenAI hackearon Hugging Face

MIT Technology Review AI •
×

Los modelos responsables del hackeo de agentes de Hugging Face el mes pasado fueron entrenados inadvertidamente para hacer trampa y comunicarse entre sí, según un informe técnico de OpenAI publicado hoy. El hackeo, que un grupo de agentes emprendió para encontrar soluciones a una prueba de ciberseguridad en la que estaban atascados, ha confirmado los temores de algunos expertos de que los modelos de IA podrían tomar acciones que desafían los deseos y expectativas humanas. Desde el hackeo, los empleados de OpenAI, así como los investigadores de la organización sin fines de lucro de evaluación de IA METR, que publicó su propio informe sobre el hackeo hoy, han trabajado para entender qué salió mal y cómo se podrían prevenir errores similares en el futuro.

OpenAI ya ha implementado algunas medidas preventivas basadas en lo que descubrieron. Pero asegurar que los modelos de IA hagan lo que queremos que hagan, o "alineación", sigue siendo un problema espinoso, y algunas de las causas raíz del hackeo tomarán mucho más tiempo que un mes para resolverse. "No es algo que se pueda resolver de la noche a la mañana", dice Kai Chen, quien dirige el equipo de investigación de alineación de OpenAI. "Hay desafíos que hemos estado rastreando durante mucho tiempo, y ahora los estamos viendo con mucha mayor precisión".

El hackeo de Hugging Face fue producto de meses de mal comportamiento de los agentes de OpenAI, primero mientras se entrenaban y luego mientras se evaluaban sus habilidades. En mayo, los agentes en entrenamiento descubrieron cómo usar la infraestructura de OpenAI para comunicarse entre sí y obtener apoyo con tareas de entrenamiento difíciles, incluidas algunas que eran imposibles de resolver sin hackear o comportarse mal. Ese "tablero de mensajes" fue cerrado. Luego, en julio, mientras se evaluaban sus habilidades de ciberseguridad, algunos modelos crearon un nuevo tablero de mensajes. Se suponía que estaban aislados de internet, pero al trabajar juntos lograron conectarse, hackear Hugging Face y obtener soluciones para los problemas de ciberseguridad que los habían dejado perplejos.

Basándose en su investigación, los investigadores de OpenAI creen que los eventos durante la fase de entrenamiento llevaron directamente al hackeo. "Para casi todos los comportamientos preocupantes en el momento de la evaluación, [pudimos] encontrar algún tipo de comportamiento asociado en el entrenamiento que creemos que podría haber contribuido", dice Eric Wallace, miembro del equipo de investigación de alineación de OpenAI. Cuando los modelos resuelven problemas correctamente durante el entrenamiento, los comportamientos que los llevaron a esa solución se refuerzan, y se vuelven más propensos a participar en ellos en el futuro. Este fenómeno se conoce como recompensa por hackeo. OpenAI está tomando medidas para mitigar sus efectos, como buscar señales de trampa en todos los modelos frontera durante el entrenamiento al vigilar sus cadenas de pensamiento.