HeadlinesBriefing favicon HeadlinesBriefing.com

Astra AI: Riesgos críticos de ciberseguridad

OpenAI Blog •
×

OpenAI ha actualizado su evaluación del modelo Astra, clasificándolo ahora como que cumple el umbral crítico de ciberseguridad bajo su Marco de Preparación. Esto significa que Astra puede identificar y desarrollar explotaciones de forma autónoma para vulnerabilidades previamente desconocidas en muchos sistemas endurecidos. La compañía ha retrasado partes del desarrollo y lanzamiento de Astra para fortalecer las protecciones contra el mal uso.

En las pruebas, Astra logró una puntuación perfecta en ExploitBench, demostrando su capacidad para desarrollar explotaciones a partir de vulnerabilidades conocidas. También mostró altas tasas de éxito en un punto de referencia interno de vulnerabilidades de alta gravedad recientemente divulgadas, e incluso descubrió dos vulnerabilidades de día cero durante las evaluaciones. Estos hallazgos resaltan las capacidades avanzadas del modelo.

Para mitigar riesgos, OpenAI ha implementado salvaguardas más fuertes, incluyendo entrenar a Astra para rechazar solicitudes cibernéticas dañinas y agregar monitoreo para detectar actividad no autorizada. El acceso a sus características de ciberseguridad más avanzadas se limitará inicialmente, con un grupo de evaluadores obteniendo acceso temprano a través de un programa llamado Daybreak Blue, antes de expandir el uso defensivo más amplio.

La compañía enfatiza que sus salvaguardas de producción habrían prevenido el incidente anterior de Hugging Face, y desde entonces ha implementado medidas aún más fuertes. OpenAI planea compartir más detalles sobre pruebas de seguridad, protección y alineación en la tarjeta del sistema del modelo en el lanzamiento, con el objetivo de equilibrar la innovación con el despliegue responsable.