HeadlinesBriefing HeadlinesBriefing.com

Ritmo de desenvolvimento diante de riscos cibernéticos

OpenAI Blog •
×

Nas últimas semanas, dois incidentes destacaram os riscos crescentes de sistemas de IA capazes: o incidente Open AI-Hugging Face e evidências de que nosso próximo modelo Astra pode atingir o limiar de capacidade crítica de cibersegurança sob nosso Quadro de Preparação. Esses desenvolvimentos, juntamente com o rápido progresso interno de pesquisa, aumentaram a urgência de fortalecer a monitorização, o alinhamento e as proteções de contenção em todas as etapas de treinamento.

À medida que os modelos se tornam mais capazes, também aumentam os riscos associados. Temporariamente reduzimos a escala, incluindo uma pausa de duas semanas no treinamento de aprendizado por reforço (RL), para endurecer os ambientes de pesquisa, os sistemas de equipe vermelha e expandir a cobertura de monitorização. Nossa maior execução de RL de fronteira permanece suspensa enquanto realizamos treinamentos e avaliações em menor escala para validar as proteções e estabelecer evidências de alinhamento.

Agora exigimos evidências mais sólidas de comportamento alinhado ao longo de todo o treinamento, baseando-nos em pesquisas e avaliações em andamento. Os sinais dos próximos modelos deixam claro a necessidade de uma abordagem mais ampla além do Quadro de Preparação atual. Abaixo, detalhamos as alterações nos processos e infraestrutura de pesquisa, e o trabalho ainda em andamento.

Nossa abordagem baseia-se em três medidas de segurança reforçadas: monitorização, alinhamento e segurança. Aplicamos essas medidas à pesquisa e ao lançamento, adaptando-as às capacidades de cada modelo, ao ambiente operacional e ao nível de risco. Modelos de ponta que adquirem capacidades mais fortes de cibersegurança exigem o aumento dos padrões de segurança dos ambientes de treinamento e avaliação.

Fonte: OpenAI Blog · Resumido por HeadlinesBriefing