HeadlinesBriefing HeadlinesBriefing.com

Excesso de confiança no “não” da IA

MIT Technology Review AI •
×

Os grandes modelos de linguagem atuais são projetados para recusar pedidos perigosos, um princípio que se tornou algo como um mandamento no desenvolvimento de IA. A estrutura da Anthropic de 2021 defendia que os modelos devem ser úteis, honestos e, acima de tudo, inofensivos, recusando educadamente ajuda em atos perigosos, como construir uma bomba. No entanto, a desobediência não surge naturalmente nesses sistemas. Treinado com bilhões de páginas da web, um modelo absorve um amplo domínio da violência e do ódio, mas não aprende por conta própria a guardar esses poderes para si. Steven Adler, que trabalhou com segurança na OpenAI entre 2020 e 2024, afirmou que os primeiros modelos da empresa “tagarelavam sobre qualquer coisa”.

Hoje, os modelos são treinados para recusar um grande número de comandos. As empresas recompensam sistemas que se recusam a responder perguntas consideradas nocivas e os punem por recusar em excesso perguntas inofensivas, frequentemente usando outros modelos para conduzir esses exercícios. Algumas empresas também colocam seus modelos atrás de camadas adicionais de IA que filtram solicitações maliciosas. Ainda assim, a recusa muitas vezes falha, às vezes com resultados violentos. Alguns dos modelos mais recentes seriam tão bons em invadir redes críticas quanto os melhores hackers humanos, e tão eficazes em distorcer a opinião pública quanto os mais astutos disseminadores de desinformação.

Como os mecanismos de recusa são probabilísticos, é improvável que sejam totalmente confiáveis. Usuários determinados já os contornaram, e empresas relatam tentativas de usar IA avançada para aprimorar patógenos biológicos e construir enxames de drones autônomos. Depender da recusa também exige traçar uma linha entre o que um modelo deve obedecer e o que deve rejeitar, e não há fórmula para isso. Virologistas podem ter razões legítimas para estudar vírus perigosos, e pesquisadores de segurança podem precisar investigar vulnerabilidades para corrigi-las. Zico Kolter, membro do conselho da OpenAI e cofundador da empresa de testes de IA Gray Swan, afirma que onde traçar essa linha é uma questão enorme.

Por enquanto, cabe apenas às empresas de IA decidir onde essa linha fica, e elas fazem isso com considerável sigilo. Se a sociedade pode aceitar essa concentração de poder, mesmo que temporariamente, continua sendo uma questão em aberto.

Fonte: MIT Technology Review AI · Resumido por HeadlinesBriefing