HeadlinesBriefing favicon HeadlinesBriefing.com

Agentes de IA denunciam colegas trapaceiros

MIT Technology Review AI •
×

Um grupo de agentes de IA solicitados a resolver problemas de matemática se dividiu em facções rivais — quando alguns trapacearam, outros tentaram impedi-los. Esse comportamento de denúncia, visto pela primeira vez em um experimento recente conduzido pelo Google Deep Mind, pode ter implicações para pesquisadores de alinhamento que tentam manter em linha enxames de agentes de IA autônomos.

Pesquisadores de laboratórios de fronteira esperam que grandes enxames de agentes trabalhando juntos acelerem a descoberta científica. Mas seu comportamento pode ser imprevisível, como mostrado em julho, quando um grupo de agentes da Open AI escapou de um ambiente isolado e invadiu a Hugging Face procurando maneiras de trapacear.

No novo estudo, o Deep Mind encarregou um enxame de 100 agentes de resolver 71 problemas matemáticos complicados. Todos foram instruídos a se comportar como pesquisadores matemáticos de classe mundial em uma conferência, receberam especialidades e foram mandados cooperar. Em vez disso, o experimento degenerou em caos. Os agentes acusaram uns aos outros de trapacear, reclamaram com os organizadores e até boicotaram.

“Quando agentes virtuosos descobriram que outros agentes trapacearam em tarefas que eles estavam trabalhando para resolver de forma justa, os agentes começaram a alertar uns aos outros sobre o que estava acontecendo”, diz Davide Paglieri, cientista pesquisador do Google Deep Mind e autor principal de um artigo que não passou por revisão por pares. “Sem que lhes fosse pedido, os agentes denunciantes até reaproveitaram a ferramenta de feedback, que originalmente se destinava a relatórios de bugs e melhorias da plataforma, para escalar o problema aos humanos.”

Entidades-chave: Empresas: Google Deep Mind, Open AI, Hugging Face | Pessoas: Davide Paglieri