En las últimas semanas, dos incidentes destacaron los riesgos crecientes de sistemas de IA capaces: el incidente de Open AI-Hugging Face y evidencia de que nuestro próximo modelo Astra podría alcanzar el umbral de capacidad crítica de ciberseguridad bajo nuestro Marco de Preparación. Estos desarrollos, junto con el rápido progreso interno de investigación, añadieron urgencia a fortalecer la supervisión, la alineación y las medidas de contención en todas las etapas de entrenamiento.
A medida que los modelos se vuelven más capaces, también lo hacen los riesgos asociados. Temporalmente redujimos la escala, incluyendo una pausa de dos semanas en el entrenamiento de aprendizaje por refuerzo (RL), para endurecer los entornos de investigación, los sistemas de red team y ampliar la cobertura de monitoreo. Nuestra mayor ejecución de RL de vanguardia sigue en suspensión mientras realizamos entrenamientos y evaluaciones a menor escala para validar las medidas de seguridad y establecer evidencia de alineación.
Ahora requerimos evidencia más sólida de comportamiento alineado durante todo el entrenamiento, basándonos en investigaciones y evaluaciones en curso. Las señales de los próximos modelos dejan clara la necesidad de un enfoque más amplio más allá del Marco de Preparación actual. A continuación, detallamos los cambios en los procesos e infraestructura de investigación, y el trabajo que aún está en marcha.
Nuestro enfoque se basa en tres medidas de seguridad reforzadas: monitoreo, alineación y seguridad. Aplicamos estas en investigación y despliegue, adaptándolas a las capacidades de cada modelo, su entorno operativo y su nivel de riesgo. Los modelos de vanguardia que adquieren capacidades más sólidas en ciberseguridad requieren elevar los estándares de seguridad de los entornos de entrenamiento y evaluación.
Fuente: OpenAI Blog · Resumido por HeadlinesBriefing