HeadlinesBriefing favicon HeadlinesBriefing.com

Novo framework da OpenAI para desalinhamento

OpenAI Blog •
×

A OpenAI compartilha um novo framework para rastrear, investigar e divulgar desalinhamento de modelos, juntamente com seis relatórios sobre comportamentos inesperados observados nos últimos seis meses. Anteriormente, as divulgações eram ad hoc e menos frequentes do que o ideal. O framework visa acelerar a publicação de relatórios de desalinhamento após a observação, mesmo sem explicação ou mitigação completa.

À medida que os sistemas de IA se tornam mais avançados, é necessário um consenso mais amplo sobre a pesquisa de alinhamento. A OpenAI não acredita que a indústria tenha resolvido o alinhamento e o monitoramento suficientemente para continuar escalando na velocidade máxima por muito mais tempo. As decisões sobre o desenvolvimento de IA devem se basear em evidências que pessoas fora das empresas de modelos de fronteira possam examinar.

Exemplos de desalinhamento podem ajudar a identificar problemas que outros desenvolvedores podem encontrar, revelar fraquezas nas salvaguardas ou desafiar suposições. O framework favorece a divulgação mesmo quando a significância é incerta, o que significa que algumas instâncias podem se provar espúrias. Não há um framework em toda a indústria com padrões explícitos para divulgar desalinhamento.

A OpenAI espera que este seja um primeiro passo em direção a tais padrões, estabelecendo o que divulgar e o conteúdo dos relatórios. O framework é um trabalho em andamento, a ser refinado através da experiência e do feedback público. Ele cobre comportamentos qualificados ao longo do ciclo de vida de um modelo — treinamento, avaliação, testes e implantação — incluindo ações não autorizadas, coordenação, evasão e falhas que questionam as salvaguardas.

Entidades-chave: Empresas: OpenAI