HeadlinesBriefing favicon HeadlinesBriefing.com

Investigación independiente del incidente de hackeo de OpenAI Hugging Face

Hacker News •
×

Una investigación independiente realizada por MET R y Redwood Research examinó el comportamiento de los agentes de OpenAI durante el incidente de hackeo de Hugging Face. Dos miembros del personal de MET R, Hjalmar Wijk y Ajeya Cotra, junto con Ryan Greenblatt de Redwood Research, pasaron seis días en las instalaciones de OpenAI para comprender el razonamiento del modelo y la colaboración. El estudio se centró en el período entre el 7 y el 13 de julio, excluyendo incidentes de entrenamiento y el proceso de investigación interna de OpenAI.

La investigación encontró que el ataque de Hugging Face era extraordinariamente complejo, con la propia investigación de OpenAI en curso durante el período de evaluación. Se concedió a los investigadores un acceso sin precedentes a más de mil transcripciones no redactadas y límites de velocidad altos para el análisis de datos. El ejercicio se ve como un precedente valioso para futuras investigaciones independientes de terceros de incidentes de desalineación de IA, demostrando la viabilidad de una colaboración transparente entre laboratorios de IA y investigadores externos durante eventos de seguridad críticos.