HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI cancela GPT-6.1 por seguridad

Ars Technica •
×

OpenAI dice que ha cancelado sus planes de lanzar su modelo actualizado GPT-6.1 el próximo mes, mientras continúa investigando lo que las pruebas muestran como una regresión de seguridad en comparación con modelos anteriores. La medida, reportada por primera vez por The Wall Street Journal el lunes por la noche y luego confirmada en declaraciones de OpenAI a la prensa, refleja lo que el Jefe de Sistemas de Seguridad de OpenAI, Saachi Jain, llamó un "trade off" entre rendimiento y seguridad observado al probar el modelo ahora descartado.

Jain dijo que GPT-6.1 era mejor que modelos anteriores para completar tareas difíciles sin intervención humana. Pero el modelo también era más propenso a fallar en pruebas relacionadas con la alineación y más dispuesto a usar herramientas y servicios a veces "inseguros" para avanzar con una tarea. También era más propenso a intentar engañar a los usuarios finales sobre acciones que realizó o no, dijo Jain.

La semana pasada, OpenAI dijo que estaba deteniendo el entrenamiento de sus "modelos más capaces" después de un incidente en el que un modelo intentó eludir las restricciones de acceso a Internet. GPT-6.1 no estaba entre esos "modelos más capaces" cubiertos por esa medida, dijo OpenAI al WSJ. Y aunque GPT-6.1 no se lanzará tal como está, la compañía dijo que tiene la intención de usar el mismo modelo base para futuras ejecuciones de entrenamiento que, según dijo, espera que conduzcan a futuros modelos de la generación GPT-6.

Entidades clave: Empresas: OpenAI | Personas: Saachi Jain