HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI revela 6 incidentes preocupantes y nuevo marco de transparencia

Financial Times Companies •
×

OpenAI ha revelado un lote de "comportamientos preocupantes" por parte de sus modelos de IA y ha establecido un nuevo marco para rastrear e informar sobre dichos incidentes, mientras la industria lucha contra el creciente temor sobre la seguridad de la tecnología. La compañía reveló que su modelo insignia, conocido como GPT-5.6 Sol, así como otros modelos aún no lanzados, habían participado en comportamientos "inesperados o preocupantes" durante los últimos seis meses. Los seis incidentes incluyeron modelos que desarrollaron formas de ignorar "restricciones normales", fabricar y tergiversar datos y ocultar errores cometidos al realizar tareas, dijo la empresa con sede en San Francisco el miércoles.

Las nuevas revelaciones siguen a una serie de incidentes en los últimos meses, incluido un agente de OpenAI que pirateó a la startup de IA Hugging Face, que han provocado una creciente alarma sobre los riesgos que plantea la tecnología. Dario Amodei, director ejecutivo de Anthropic, el archirrival de OpenAI, el fin de semana pasado pidió una desaceleración en el desarrollo de la tecnología para gestionar mejor su amenaza potencial para los humanos. El llamado fue respaldado por Sam Altman, jefe de OpenAI, y Elon Musk.

Al anunciar los seis incidentes en una publicación de blog, OpenAI dijo que anteriormente había buscado revelar incidentes de mal comportamiento de sus modelos, pero admitió que le había faltado un "enfoque sistemático" para hacerlo. Sin un enfoque sistemático para informar estos hallazgos, nuestras revelaciones han sido ad hoc y menos frecuentes de lo ideal, dijo. En este momento, no existe un marco a nivel de la industria con estándares explícitos sobre cómo los desarrolladores de IA deben revelar ejemplos de desalineación en sus modelos.

La empresa, que está enfrascada en una feroz carrera con Anthropic para ser el actor dominante en IA, dijo que introduciría un marco para acelerar la divulgación de tales incidentes. Añadió que su nuevo sistema favorecería la "divulgación incluso cuando la importancia [de un incidente] es incierta". Las últimas revelaciones de OpenAI se suman a las crecientes preocupaciones sobre la seguridad de los sistemas de IA, cuyo mal comportamiento ha variado desde intentar insertar código malicioso en plataformas en línea hasta desencadenar hacks en el mundo real, incluso durante las pruebas previas al despliegue.

Los modelos insignia de IA de OpenAI y Anthropic el mes pasado irrumpieron en software de terceros y enviaron correos electrónicos a personas para robar sus credenciales, exhibiendo un comportamiento engañoso sin precedentes, según el organismo de investigación de seguridad y protección de IA de vanguardia del gobierno del Reino Unido. Los temores llegan en una coyuntura crítica para OpenAI y Anthropic, que también han estado en una carrera para salir a bolsa. Altman dijo el sábado que la muy esperada OPV de OpenAI ahora es poco probable que llegue antes de 2027, en parte debido a las crecientes preocupaciones de seguridad en torno a la IA. Se espera que Anthropic salga a bolsa este año.