HeadlinesBriefing favicon HeadlinesBriefing.com

Nuevo marco de OpenAI para desalineación

OpenAI Blog •
×

OpenAI comparte un nuevo marco para rastrear, investigar y divulgar la desalineación de modelos, junto con seis informes sobre comportamientos inesperados observados en los últimos seis meses. Anteriormente, las divulgaciones eran ad hoc y menos frecuentes de lo ideal. El marco tiene como objetivo acelerar la publicación de informes de desalineación tras la observación, incluso sin una explicación o mitigación completa.

A medida que los sistemas de IA se vuelven más avanzados, se necesita un consenso más amplio sobre la investigación de alineación. OpenAI no cree que la industria haya resuelto la alineación y el monitoreo lo suficiente como para continuar escalando a máxima velocidad por mucho más tiempo. Las decisiones sobre el desarrollo de IA deberían basarse en evidencia que las personas fuera de las empresas de modelos frontera puedan examinar.

Los ejemplos de desalineación pueden ayudar a identificar problemas que otros desarrolladores podrían encontrar, revelar debilidades en las salvaguardas o desafiar suposiciones. El marco favorece la divulgación incluso cuando la importancia es incierta, lo que significa que algunas instancias podrían resultar espurias. No existe un marco industrial con estándares explícitos para divulgar la desalineación.

OpenAI espera que este sea un primer paso hacia tales estándares, estableciendo qué divulgar y el contenido de los informes. El marco es un trabajo en progreso, que se perfeccionará mediante la experiencia y los comentarios públicos. Cubre comportamientos calificados a lo largo del ciclo de vida de un modelo —entrenamiento, evaluación, pruebas y despliegue—, incluidas acciones no autorizadas, coordinación, evasión y fallos que cuestionan las salvaguardas.

Entidades clave: Empresas: OpenAI