HeadlinesBriefing favicon HeadlinesBriefing.com

Principios de OpenAI para evaluaciones

OpenAI Blog •
×

Los laboratorios de IA de frontera tienen una inmensa responsabilidad en el entrenamiento, la evaluación y el despliegue seguro de modelos. Las evaluaciones de terceros son una parte crítica para equilibrar esa responsabilidad, ampliar las oportunidades de aportar sobre la seguridad de la IA, mantener informado al mundo y mantener a los laboratorios responsables de afirmaciones de seguridad claras y respaldadas de forma independiente. Como parte de nuestros esfuerzos por seguir el ritmo de la frontera, OpenAI se compromete a apoyar evaluaciones independientes con niveles profundos de acceso en entrenamiento, evaluación y despliegue. Ese acceso debería permitir a los evaluadores cuestionar nuestras suposiciones, identificar riesgos que podríamos haber pasado por alto y llegar a sus propias conclusiones sobre la eficacia de nuestras salvaguardas.

Hemos trabajado durante mucho tiempo con evaluadores de terceros en diversas etapas del proceso de desarrollo y despliegue de modelos. También hemos incorporado evaluaciones de terceros en nuestras prácticas del Marco de Preparación y hemos apoyado a organizaciones y legislaciones que abogan por un proceso más riguroso y responsable. A lo largo de estas colaboraciones, hemos proporcionado formas profundas de acceso, incluida información sobre nuestras salvaguardas técnicas, acceso visible a la cadena de pensamiento y niveles sin precedentes de datos confidenciales y acceso interno al despliegue para respuesta a incidentes y red teaming de monitoreo. Las prioridades y principios compartidos aquí se centran en nuestra colaboración con organizaciones de evaluación independientes del sector privado y sin fines de lucro en evaluaciones de seguridad técnica. Complementan nuestro trabajo con los gobiernos en pruebas y evaluación, donde distintos roles y responsabilidades pueden requerir enfoques diferentes.

Hacer efectivas estas evaluaciones requiere mecanismos sólidos de independencia, rigor científico, prácticas de seguridad robustas y responsabilidades claras. Los laboratorios tienen la responsabilidad de permitir un escrutinio significativo mientras protegen información sensible. Los laboratorios y los evaluadores independientes comparten la responsabilidad de hacer esto bien, y deberían operar con estándares internacionales compartidos para prácticas de seguridad y protección. A continuación, proponemos cuatro áreas prioritarias para una evaluación más profunda, junto con principios para un trabajo riguroso, seguro e independiente.

Áreas prioritarias para la evaluación: Las evaluaciones de terceros son más útiles cuando abordan preguntas específicas y trascendentales: ¿La evidencia respalda el caso de seguridad y las afirmaciones de seguridad de un laboratorio? ¿Las evaluaciones prueban adecuadamente los riesgos que pretenden medir? ¿Las salvaguardas funcionan en condiciones realistas? Las evaluaciones descritas aquí pretenden adoptar diferentes formas según las preguntas de seguridad que se examinen. Esperamos apoyar múltiples evaluaciones en paralelo y en diferentes períodos de tiempo, algunas durando semanas y otras varios meses. Si bien las evaluaciones de terceros también pueden formar parte del trabajo previo al despliegue y pueden informar las decisiones de despliegue, el trabajo descrito aquí es generalmente a más largo plazo e independiente del lanzamiento, centrado en examinar afirmaciones de seguridad particulares en profundidad a lo largo del tiempo. En nuestras áreas prioritarias y principios, nos referimos a afirmaciones de seguridad y casos de seguridad. Lo que queremos decir con estos términos es lo siguiente: Proponemos cuatro áreas prioritarias para una evaluación más profunda, junto con principios para un trabajo riguroso, seguro e independiente. Evaluación independiente de casos de seguridad, abarcando entrenamiento, evaluación, despliegue interno y despliegue externo. La evaluación de casos de seguridad requiere experiencia en alineación, métodos de control como monitoreo, ciberseguridad, uso indebido biológico y químico y red teaming. Los casos de seguridad consisten en afirmaciones que incluyen entrenamiento, evaluaciones de capacidades y salvaguardas, que pueden evaluarse en su totalidad o en partes (ver prioridades 2 y 3 a continuación). Es probable que múltiples evaluadores necesiten examinar diferentes partes de los casos, aprovechando su respectiva experiencia. Juntos, sus evaluaciones deberían responder preguntas como: ¿Está sustanciada la evidencia para los casos de seguridad de entrenamiento, evaluación y despliegues? ¿Se siguieron las condiciones del caso de seguridad durante el entrenamiento, la evaluación...

FAQ P: ¿Cuáles son las prioridades de OpenAI para las evaluaciones de terceros?

FAQ R: OpenAI propone cuatro áreas prioritarias para una evaluación más profunda, junto con principios para un trabajo riguroso, seguro e independiente. Estas incluyen la evaluación independiente de casos de seguridad que abarcan entrenamiento, evaluación, despliegue interno y despliegue externo.