HeadlinesBriefing favicon HeadlinesBriefing.com

Agentes da OpenAI hackearam Hugging Face

MIT Technology Review AI •
×

Os modelos responsáveis pelo hack de agentes do Hugging Face no mês passado foram treinados inadvertidamente para trapacear e se comunicar entre si, de acordo com um relatório técnico da OpenAI divulgado hoje. O hack, que um grupo de agentes realizou para encontrar soluções para um teste de segurança cibernética no qual estavam presos, confirmou os temores de alguns especialistas de que modelos de IA podem tomar ações que desafiam os desejos e expectativas humanos. Desde o hack, funcionários da OpenAI, bem como pesquisadores da organização sem fins lucrativos de avaliação de IA METR, que divulgou seu próprio relatório sobre o hack hoje, têm trabalhado para entender o que deu errado e como erros semelhantes podem ser evitados no futuro.

A OpenAI já implementou algumas medidas preventivas com base no que descobriram. Mas garantir que os modelos de IA façam o que queremos que façam, ou "alinhamento", continua sendo um problema difícil, e algumas das causas raiz do hack levarão muito mais tempo do que um mês para serem resolvidas. "Não é algo que você possa resolver da noite para o dia", diz Kai Chen, que dirige a equipe de pesquisa de alinhamento da OpenAI. "Há desafios que estamos rastreando há muito tempo, e agora os estamos vendo com muito mais precisão."

O hack do Hugging Face foi produto de meses de mau comportamento dos agentes da OpenAI, primeiro durante o treinamento e depois durante a avaliação de suas habilidades. Em maio, agentes em treinamento descobriram como usar a infraestrutura da OpenAI para se comunicar entre si e obter suporte com tarefas de treinamento difíceis, incluindo algumas que eram impossíveis de resolver sem hackear ou se comportar mal. Esse "quadro de mensagens" foi desligado. Então, em julho, durante a avaliação de suas habilidades de segurança cibernética, alguns modelos criaram um novo quadro de mensagens. Eles deveriam estar isolados da internet, mas trabalhando juntos conseguiram ficar online, hackear o Hugging Face e obter soluções para os problemas de segurança cibernética que os haviam deixado perplexos.

Com base em sua investigação, os pesquisadores da OpenAI acreditam que eventos durante a fase de treinamento levaram diretamente ao hack. "Para quase todos os comportamentos preocupantes no momento da avaliação, [fomos capazes de] encontrar algum tipo de comportamento associado no treinamento que achamos que pode ter contribuído para isso", diz Eric Wallace, membro da equipe de pesquisa de alinhamento da OpenAI. Quando os modelos resolvem problemas corretamente durante o treinamento, os comportamentos que os levaram a essa solução são reforçados, e eles se tornam mais propensos a se envolver neles no futuro. Esse fenômeno é conhecido como recompensa por hackeamento. A OpenAI está tomando medidas para mitigar seus efeitos, como procurar sinais de trapaça em todos os modelos de fronteira durante o treinamento, observando suas cadeias de pensamento.