Nas últimas semanas, dois incidentes destacaram os riscos crescentes de sistemas de IA capazes: o incidente Open AI-Hugging Face e evidências de que nosso próximo modelo Astra pode atingir o limiar de capacidade crítica de cibersegurança sob nosso Quadro de Preparação. Esses desenvolvimentos, juntamente com o rápido progresso interno de pesquisa, aumentaram a urgência de fortalecer a monitorização, o alinhamento e as proteções de contenção em todas as etapas de treinamento.
À medida que os modelos se tornam mais capazes, também aumentam os riscos associados. Temporariamente reduzimos a escala, incluindo uma pausa de duas semanas no treinamento de aprendizado por reforço (RL), para endurecer os ambientes de pesquisa, os sistemas de equipe vermelha e expandir a cobertura de monitorização. Nossa maior execução de RL de fronteira permanece suspensa enquanto realizamos treinamentos e avaliações em menor escala para validar as proteções e estabelecer evidências de alinhamento.
Agora exigimos evidências mais sólidas de comportamento alinhado ao longo de todo o treinamento, baseando-nos em pesquisas e avaliações em andamento. Os sinais dos próximos modelos deixam claro a necessidade de uma abordagem mais ampla além do Quadro de Preparação atual. Abaixo, detalhamos as alterações nos processos e infraestrutura de pesquisa, e o trabalho ainda em andamento.
Nossa abordagem baseia-se em três medidas de segurança reforçadas: monitorização, alinhamento e segurança. Aplicamos essas medidas à pesquisa e ao lançamento, adaptando-as às capacidades de cada modelo, ao ambiente operacional e ao nível de risco. Modelos de ponta que adquirem capacidades mais fortes de cibersegurança exigem o aumento dos padrões de segurança dos ambientes de treinamento e avaliação.
Fonte: OpenAI Blog · Resumido por HeadlinesBriefing