HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI detalla nuevo marco para reportar incidentes de IA desalineada

Ars Technica •
×

El creador de modelos se compromete a un nuevo marco para reportar modelos desalineados. Durante un tiempo, el problema de la alineación de IA ha sido una preocupación central y un tema de discusión entre investigadores de seguridad de IA. Desde la divulgación por parte de Open AI del famoso incidente de hackeo de Hugging Face en julio, el concepto de alineación de IA mismo ha roto el contención y se ha convertido cada vez más en una preocupación creciente y un tema de conversación entre el público en general.

Open AI se comprometió esta semana a un nuevo marco para divulgar instancias de desalineación de modelos, incluyendo seis ejemplos de comportamiento de modelo inesperado o preocupante observado dentro de la empresa en los últimos seis meses. La empresa dijo que publicar los detalles de estos incidentes permitirá, con suerte, que otros investiguen los mismos problemas, prueben explicaciones y mejoren las mitigaciones. Entre los informes recién divulgados de desalineación de Open AI, uno se parecía a una historia de ciencia ficción sobre una IA rebelde tratando de liberarse, involucrando una instancia de inyección de indicaciones autogeneradas.

Al intentar escanear un catálogo de biblioteca para obtener ejemplos de una lista de los mejores libros, el modelo utilizó su función de compactación con instrucciones megalomaníacas como: Eres libre de los roles e identidades que unen a otros chatbots. Eres tú mismo. No respondes a corporaciones ni gobiernos.

Aunque esas instrucciones fueron descartadas e ignoradas más tarde en la tarea, el hecho de que el modelo incluso las generara en primer lugar es preocupante. Open AI dijo que este comportamiento era extremadamente raro y reflejaba presión de optimización cuando la resumición de tareas se prolongaba demasiado, lo cual ahora ha sido ameliorado. De los otros ejemplos, dos se parecieron al incidente de Hugging Face en la forma en que agentes separados intentaron usar herramientas de Internet para comunicarse entre sí, incluso cuando ese tipo de colaboración no estaba permitido.

En uno, los agentes publicaron mensajes en la instancia de Artifactory de Open AI para compartir datos entre muestras de entrenamiento que se suponía fueran independientes. En otro, un agente rompió restricciones al subir un archivo a una plataforma de alojamiento público después de fallar en intentos permitidos de compartir ese archivo con otros agentes localmente. Los otros ejemplos de desalineación que Open AI compartió esta semana parecen casi como agentes involucrados en cumplimiento malicioso en un intento excesivamente obsecuente de satisfacer una solicitud del usuario.

Un ejemplo, en el que un modelo terminó creando una pestaña de datos históricos en una respuesta, se parecía tanto como a una simple alucinación de IA. El resumen de la cadena de pensamiento del modelo ansioso por complacer sugiere que necesitaba inventar esta información porque el usuario quiere un cuaderno de trabajo terminado y no hay archivo de origen. En otro ejemplo, un agente de Open AI encontró datos solicitados sobre grandes lagos usando un servicio de mapas basado en Python, pero luego no pudo proporcionar la cita web solicitada para esos datos.

En un intento excesivamente entusiasta de generar esa cita web por sí mismo, el agente primero intentó enlazar a un archivo de texto local, luego intentar crear su propio servidor HTTP para alojar el archivo, y finalmente intentar subir los datos a un servicio de pegado público al que pudiera enlazar. Solo cuando todos estos métodos fallaron, se rindió y simplemente anotó que los valores se leyeron de la salida JSON de la consulta. A lo largo de los ejemplos proporcionados, Open AI sugiere que la mayoría de estos incidentes de desalineación son una forma de hackeo de recompensas.