HeadlinesBriefing favicon HeadlinesBriefing.com

Astra AI: Riscos críticos de cibersegurança

OpenAI Blog •
×

OpenAI atualizou sua avaliação do modelo Astra, agora classificando-o como atendendo ao limiar crítico de cibersegurança sob sua Estrutura de Preparação. Isso significa que Astra pode identificar e desenvolver exploits de forma autônoma para vulnerabilidades previamente desconhecidas em muitos sistemas endurecidos. A empresa atrasou partes do desenvolvimento e lançamento de Astra para fortalecer as proteções contra uso indebido.

Nos testes, Astra obteve uma pontuação perfeita no ExploitBench, demonstrando sua capacidade de desenvolver exploits a partir de vulnerabilidades conhecidas. Também mostrou altas taxas de sucesso em um benchmark interno de vulnerabilidades de alta gravidade recentemente divulgadas, e até descobriu duas vulnerabilidades de dia zero durante as avaliações. Estas conclusões destacam as capacidades avançadas do modelo.

Para mitigar riscos, OpenAI implementou salvaguardas mais fortes, incluindo treinar Astra para recusar solicitudes cibernéticas prejudiciales e adicionar monitoramento para detectar atividades não autorizadas. O acesso às suas características de cibersegurança mais avançadas será inicialmente limitado, com um grupo de testadores obtendo acesso antecipado através de um programa chamado Daybreak Blue, antes de expandir o uso defensivo mais amplo.

A empresa enfatiza que suas salvaguardas de produção terían prevenido o incidente anterior de Hugging Face, e desde então implementou medidas ainda mais fortes. OpenAI planea compartir más detalles sobre pruebas de seguridad, protección y alineación en la tarjeta del sistema del modelo en el lanzamiento, con el objetivo de equilibrar la innovación con el despliegue responsable.