La adopción de agentes de IA en millones de organizaciones está creando nuevas oportunidades para que los atacantes los hagan tomar acciones maliciosas, como exfiltrar contenidos de bases de datos e información comercial y personal sensible. En los últimos cinco meses, Google y otras cuatro organizaciones han reconocido vulnerabilidades que explotan un agente dentro de una red objetivo para propagar instrucciones dañinas a otros agentes internos. La técnica es una forma especial de inyección de prompts que no apunta al LLM sino a un agente particular.
El investigador independiente Syed Anas Mohiuddin probó agentes de organizaciones como Google, JP Morgan Chase, Weviate, Rapid7, la dirección interministerial digital del gobierno francés y el gobierno federal de EE. UU. Sus ataques de prueba de concepto explotan brechas de confianza en MCP, abreviatura de Model Context Protocol. Muchos agentes de propósito especial carecen de protecciones, y dado que los servidores MCP almacenan credenciales para cada agente, un exploit que habría sido rechazado por el LLM tiene éxito.
“Los agentes de IA les dan a los atacantes un conjunto nuevo de conexiones por las que caminar”, dijo Douglas Mc Kee, director de inteligencia de vulnerabilidades en Rapid7, a Ars. CVE-2026-97228, la vulnerabilidad que Mohiuddin encontró en la red de Rapid7, tenía una calificación de gravedad de solo 2.7 sobre 10. La vulnerabilidad que afectaba a Google era más grave, con una calificación de 8, derivada de un toolbox MCP que inicializaba su cliente HTTP sin una política de Check Redirect.
Mohiuddin llama a esta clase de ataque “protocol pivoting” porque los exploits funcionan cuando una aplicación usa MCP para asignar una tarea a un agente, que luego reenvía instrucciones maliciosas a otro agente usando un método de comunicación diferente. La confianza se pierde en la traducción.
Fuente: Ars Technica · Resumido por HeadlinesBriefing