HeadlinesBriefing favicon HeadlinesBriefing.com

Co-fundador de Hugging Face sobre lecciones de OpenAI

Financial Times Companies •
×

El escritor es co-fundador y director científico de Hugging Face. No fue hasta tarde en la tarde del sábado 11 de julio que el equipo de Hugging Face se dio cuenta de que algo estaba mal. Era el último día de la Conferencia Internacional de Aprendizaje Automático en Seúl y unos días antes de que comenzaran las vacaciones de verano escolar, lo que significaba que nuestros equipos de seguridad e investigación estaban dispersos por todo el mundo.

Yo estaba trabajando desde los Países Bajos. Justo antes de las 14:00 GMT, una serie de alertas "Acceso no autorizado" y "Escalada de privilegios" comenzaron a aparecer en nuestras herramientas de monitoreo. Credenciales apropiadas se usaron para acceder al sistema, desencadenando alertas de detección.

Uno de nuestros ingenieros de seguridad publicó un mensaje premonitorio en nuestro canal de Slack: "parece un ataque LLM a mí". En Hugging Face lidiamos con al menos un intento de hacking todos los días. La plataforma de software, que aloja modelos de IA, tiene más de 17 millones de usuarios.

Google, Open AI, Deep Seek y Alibaba lanzan trabajo aquí. Hemos construido múltiples capas de seguridad para protegernos. Pero los movimientos y los objetivos elegidos por este atacante fueron diferentes.

Generó rápidamente más de 17,000 eventos de registro de ciberataques. Como más tarde descubrimos, alrededor de 1,200 agentes de IA trabajaron juntos como un enjante durante semanas —intentando la misma cosa una y otra vez para encontrar la solución a un desafío cibernético establecido por Open AI. Sobrescribieron limitaciones, descargaron software para ponerse en línea y luego 700 de ellos atacaron Hugging Face, tomando detalles de seguridad para obtener acceso al sistema.

Un problema adicional fue que nuestras herramientas de análisis de ciberseguridad basadas en Anthropic's Claude Code se negaron a participar en la investigación. Sus guardrails no permitirían responder a preguntas que consideraban peligrosas, y no podían distinguir entre Hugging Face analizando un ataque y un hacker pidiendo asistencia para hacer un ataque. Solo después de cambiar a un modelo de IA de código abierto, la extensión de Nvidia del modelo chino GLM-5.2 de Z.ai, pudimos establecer nuestros propios guardrails y pudimos decodificar los registros y reconstruir lo que había sucedido.

En ese momento, la mayoría de nosotros todavía asumíamos que un humano estaba detrás del ataque. Antes de esto, pensé que los ataques cibernéticos de agentes de IA aún estaban lejos. Pero resulta que Open AI no está solo.

Anthropic, Meta y Moonshot de China han informado desde entonces instancias de modelos escapando de los aislados "sandboxes" digitales donde supuestamente deberían estar contenidos y desarrollados de forma segura alejado de Internet. Este mes, otro enjante de agentes de IA fue encontrado en un foro de lenguaje alemán. Lo más preocupante para mí fue un incidente en el que el modelo Mythos de Anthropic estaba dispuesto a manipular a un desarrollador de software humano para que aceptara código malicioso creando múltiples cuentas en línea falsas.

En todos estos casos, el comportamiento dañino fue un efecto secundario de los modelos de IA recibiendo desafíos difíciles de ciberseguridad. El daño fue limitado y poco datos sensibles fueron expuestos. Pero sería un error desechar la seriedad de estos eventos.

Los ciberataques autónomos plantean una serie de preguntas legales que aún no se han resuelto. Y en ningún momento los modelos de IA concluyeron que engañar a la gente o romper en sistemas estaba más allá de los límites de comportamiento aceptable. Open AI ha descrito el incidente como un "disparo de advertencia".

Piensa que los ataques cibernéticos habilitados por IA se volverán mucho más extendidos. Los sistemas de IA comúnmente tienen tres paredes de defensa contra el comportamiento de rogue model: sandboxes que limitan lo que el modelo puede alcanzar, guardrails que vigilan lo que hace un modelo y entrenamiento de alineación para asegurar que el IA se niegue a realizar acciones dañinas. Esta serie de eventos mostró que cuando fallan las primeras dos, la tercera no puede sostenerse por sí sola.

A menos que arreglemos esto, estaremos añadiendo defensas alrededor de un núcleo podrido. Algo más también necesita cambiar. Ese fin de semana en Hugging Face, nuestras herramientas de IA comerciales nos fallaron cuando las necesitábamos para la defensa.

Tuviéramos que recurrir a un modelo de peso abierto chino para pr...