A adoção de agentes de IA em milhões de organizações está criando novas oportunidades para atacantes fazê-los realizar ações maliciosas, como exfiltrar conteúdos de bancos de dados e informações comerciais e pessoais sensíveis. Nos últimos cinco meses, o Google e outras quatro organizações reconheceram vulnerabilidades que exploram um agente dentro de uma rede alvo para espalhar instruções prejudiciais para outros agentes internos. A técnica é uma forma especial de injeção de prompt que visa não o LLM, mas um agente específico.
O pesquisador independente Syed Anas Mohiuddin testou agentes de organizações como Google, JP Morgan Chase, Weviate, Rapid7, a diretoria digital interministerial do governo francês e o governo federal dos EUA. Seus ataques de prova de conceito exploram lacunas de confiança no MCP, abreviação de Model Context Protocol. Muitos agentes de propósito especial carecem de proteções, e como os servidores MCP armazenam credenciais para cada agente, uma exploração que teria sido rejeitada pelo LLM é bem-sucedida.
“Agentes de IA dão aos atacantes um novo conjunto de conexões para atravessar”, disse Douglas Mc Kee, diretor de inteligência de vulnerabilidades da Rapid7, ao Ars. CVE-2026-97228, a vulnerabilidade que Mohiuddin encontrou na rede da Rapid7, tinha uma classificação de gravidade de apenas 2,7 em 10. A vulnerabilidade que afetou o Google foi mais grave, com uma classificação de 8, decorrente de uma caixa de ferramentas MCP que inicializou seu cliente HTTP sem uma política de Check Redirect.
Mohiuddin está chamando essa classe de ataque de “protocol pivoting” porque as explorações funcionam quando um aplicativo usa MCP para atribuir uma tarefa a um agente, que então encaminha instruções maliciosas para outro agente usando um método de comunicação diferente. A confiança se perde na tradução.
Fonte: Ars Technica · Resumido por HeadlinesBriefing