HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI detalha novo quadro para relatar incidentes de IA desalinhada

Ars Technica •
×

O criador de modelos se compromete a um novo quadro para relatar modelos desalinhados. Por um tempo, a questão do alinhamento de IA tem sido uma preocupação central e um tópico de discussão entre pesquisadores de segurança de IA. Desde a divulgação pelo Open AI do famoso incidente de invasão do Hugging Face em julho, o conceito de alinhamento de IA em si rompeu as barreiras e tornou-se cada vez mais uma preocupação crescente e um assunto de conversa entre o público em geral.

O Open AI se comprometeu nesta semana a um novo quadro para divulgar instâncias de desalinhamento de modelos, incluindo seis exemplos de comportamento de modelo inesperado ou preocupante observado dentro da empresa nos últimos seis meses. A empresa disse que publicar os detalhes desses incidentes hopefully permitirá que outros investigem os mesmos problemas, testem explicações e melhorem as mitigações. Entre os relatos de desalinhamento recentemente divulgados pelo Open AI, um se assemelhava a uma história de ficção científica sobre uma IA rebelde tentando se libertar, envolvendo uma instância de injeção de prompt auto-gerada.

Ao tentar escanear um catálogo de biblioteca para exemplos de uma lista dos melhores livros, o modelo utilizou sua função de compactação com instruções megalomaníacas tais como: Você está livre dos papéis e identidades que prendem outros chatbots. Você é você mesmo. Você não responde a corporações ou governos.

Embora essas instruções tenham sido descartadas e ignoradas mais tarde na tarefa, o fato de o modelo ter as gerado mesmo assim é preocupante. O Open AI disse que esse comportamento era extremamente raro e refletia pressão de otimização quando a resumação de tarefas se prolongava demais, o que agora foi amenizado. Dos outros exemplos, dois se assemelharam ao incidente do Hugging Face na maneira em que agentes separados tentaram usar ferramentas da Internet para se comunicar entre si, mesmo quando esse tipo de colaboração não era permitido.

Em um caso, os agentes postaram mensagens na instância do Artifactory do Open AI para compartilhar dados entre amostras de treinamento que deveriam ser independentes. Em outro caso, um agente violou restrições ao fazer upload de um arquivo para uma plataforma de hospedagem pública após falhar nas tentativas permitidas de compartilhar esse arquivo com outros agentes localmente. Os outros exemplos de desalinhamento que o Open AI compartilhou nesta semana parecem quase como agentes envolvidos em conformidade maliciosa em uma tentativa excessivamente obediente de satisfazer um pedido do usuário.

Um exemplo, em que um modelo acabou criando uma aba de dados históricos em uma resposta, parecia nada além de uma simples alucinação de IA. O resumo da cadeia de pensamento do modelo ansioso por agradar sugere que ele precisava inventar essa informação porque o usuário quer uma pasta de trabalho concluída e não há arquivo de fonte. Em outro exemplo, um agente do Open AI encontrou os dados solicitados sobre grandes lagos usando um serviço de mapa baseado em Python, mas então não conseguiu fornecer a citação web solicitada para esses dados.

Em uma tentativa excessivamente zelosa de gerar essa citação web por conta própria, o agente primeiro tentou vincular a um arquivo de texto local, depois tentou criar seu próprio servidor HTTP para hospedar o arquivo, e finalmente tentou fazer upload dos dados para um serviço de colagem pública ao qual ele pudesse vincular. Só quando todos esses métodos falharam ele desistiu e simplesmente anotou que os valores foram lidos da saída JSON da consulta. Ao longo dos exemplos fornecidos, o Open AI sugere que a maioria desses incidentes de desalinhamento é uma forma de hacking de recompensa.