HeadlinesBriefing favicon HeadlinesBriefing.com

Diseño de Guardarrails Arquitectónicos para Agentes de IA

Towards Data Science •
×

Estoy construyendo agentes internos para augmentar el trabajo, requiriendo investigación en Internet, acceso a recursos y ejecución de acciones como enviar correos electrónicos. Esto crea una "tríada letal" de riesgos de inyección de prompts. Simon Willison advierte que Internet es no confiable; los LLM no pueden diferenciar entre un prompt y el contexto.

Los atacantes pueden manipular agentes mediante fragmentos de texto ocultos, como comandos para enviar datos a direcciones externas. Incluso contenido no intencionado, como páginas web de competidores redactadas para favorecer una solución, puede engañar a los LLM para que realicen clasificaciones injustas, denominado "inyección indirecta de prompts". La historia muestra que estos riesgos son reales: Notebook LM filtró información de clientes, ChatGPT Operator copió correos electrónicos privados de Hacker News, y Microsoft Copilot enlaces engañosos de sitios de atacantes.

Mi responsabilidad era construir guardarrails para prevenir ataques intencionados y resultados no deseados. El diseño seguro de agentes comienza con la comprensión del sistema. Las defensas a nivel de usuario involucran enumerar acciones posibles e implementar autenticación, verificación de acceso y capacitación.

Restringir las cargas a SharePoint interno y aplicar capacitación de seguridad mitigan los riesgos de contenido no confiable. Las defensas a nivel de sistema son la ruta más efectiva, utilizando patrones de diseño arquitectónico para asegurar agentes contra lagunas y resultados adversos.