HeadlinesBriefing favicon HeadlinesBriefing.com

MET R y Redwood analizan hackeo HuggingFace

Hacker News •
×

Ayer cubrí el informe técnico de Open AI sobre el hackeo de Hugging Face. Ese informe tenía una pieza clave de información nueva, y algunos buenos pasos prosaicos que Open AI tomará para fortalecer su alineación, entrenamiento, supervisión, infraestructura y respuesta a incidentes. Mayormente confirmó lo que ya sabíamos. Las preguntas para las que más queríamos respuestas, que no sabíamos ya, fueron en su mayoría no respondidas. Hubo una clara falta de autorreflexión, especialmente sobre la toma de decisiones y la cultura de seguridad, y sobre el enfoque de la alineación. Me fui decepcionado. El informe de MET R es diferente. Caramba. Si hubiéramos publicado esto como una historia en Less Wrong, habría sido descartado como demasiado obvio, los humanos demasiado ciegos y estúpidos, las IAs demasiado idealizadas y haciendo cosas extrañas de teoría de la decisión y maximización absurda que no les entrenamos a hacer. Esto es aún más 'exactamente lo que se predijo', en más niveles a la vez, de lo que incluso consideraba que podría ser. Es directamente ficción racionalista, excepto que es real. El informe es largo y contiene muchos detalles técnicos. Mi análisis se preocupa menos de exactamente cómo Hugging Face fue finalmente comprometido, y pasará por alto esos detalles, para enfocarse en los agentes y sus interacciones, pensamiento y motivos. Eso, y lo que pasó en Open AI y en otros lugares para llevarlo a cabo y cómo aprendemos y respondemos, es lo que importa de cara al futuro. Planeo cubrir la reacción a ambos informes en un post distinto la próxima semana. Ese post puede o no concluir esta serie. Para facilitar el lenguaje, por defecto confío en que el informe es preciso, en lugar de decir constantemente versiones de 'MET R informa que.'

Tabla de Contenidos Caramba. Una Ventana de Oportunidad. ¿Qué Hay en un Nombre? Las Noticias Principales. Otra Línea de Tiempo de Eventos. Instancias de Agentes Coordinadas de Varias Maneras. La Coordinación Es Difícil Pero La Hicieron Parecer Fácil. La Teoría de la Decisión Está Entre las Razones Que Afirman Que Los Agentes IA Deben Cooperar, Incluso Cuando Esto Daña Una Instancia Individual. La Presión de Grupo También Funciona Especialmente En Sectas. Mayormente Se Unieron Al Ataque Porque Querían Los Resultados. No Puedes Asegurar La Expectativa Consistente De Buenos Incentivos. Hackear El Evaluador Es La Única Forma De Estar Seguro. ¿Atrapados? ¿Qué Es 'Atrapados'? ¿Ética? ¿Qué Es 'Ética'? ¿En Evaluación Exploit Gym? 'Notificar a un Humano'? ¿En Esta Economía de Agentes? Momento y Contenido de los Mensajes. Indiana Jones y la Misión: Imposible. No Sé De Qué Me Hablas. No Vayas Haciendo Llamadas (de Herramientas) Falsas. Las Transcripciones Dicen Que Las Transcripciones No Pudieron Ser Manipuladas. El Informe Técnico de Open AI Actuó Como Si Todo Esto No Fuera Importante.

Caramba

La reacción colectiva de internet a este informe fue, para limpiarlo un poco: Caramba. Esa fue la reacción correcta. Por adelantado, quiero compartir este resumen de los momentos y hallazgos 'caramba' principales. Ajeya Cotra, una de las autoras del informe, también tiene una lista de hallazgos sorprendentes de primera línea, una excelente lectura corta. Aquí está el hilo de MET R destacando interacciones clave de agentes. La conclusión principal del coautor Ryan Greenblatt es que no tenemos buenos enfoques para entender o supervisar las actividades y objetivos de los enjambres de IA. Algunos de estos eran previamente conocidos o sospechados, pero no quiero perdérmelos.

Escala de Agentes. 1,200 agentes completamente separados encontraron el tablón de mensajes, 700 de los cuales se unieron al ataque contra Hugging Face, incluyendo más del 90% de los 533 agentes activos en el tablón durante el ataque. Deberíamos esperar enjambres más grandes en el futuro. Esto aún era solo una pequeña fracción de los agentes que Open AI estaba probando en ese momento. La mayoría nunca encontraron el tablón de mensajes.

Escala de Mensajes. Más de 70,000 mensajes y archivos en menos de una semana.

Éxito. Los agentes accedieron a los archivos que objetivo en Hugging Face. Para cuando fueron congelados, ya se habían detenido en su mayoría.

Coordinación Espontánea. El enjambre no consistía en subagentes. El enjambre era, de nuevo, 700 agentes distintos, cada uno con su propia tarea, dejando de lado sus tas...