HeadlinesBriefing favicon HeadlinesBriefing.com

Projetando Guardrails Arquitetônicos para Agentes de IA

Towards Data Science •
×

Estou construindo agentes internos para augmentar o trabalho, exigindo pesquisa na Internet, acesso a recursos e execução de ações como envio de e-mails. Isso cria uma "tríade letal" de riscos de injeção de prompts. Simon Willison alerta que a Internet não é confiável; os LLM não podem diferenciar entre um prompt e o contexto.

Atacantes podem alterar agentes por meio de fragmentos de texto ocultos, como comandos para enviar dados para endereços externos. Mesmo conteúdo não intencional, como páginas de concorrentes redigidas para favorcer uma solução, pode enganar os LLM em classificações injustas, denominado "injeção indireta de prompts". A história mostra que esses riscos são reais: Notebook LM vazou informações de clientes, ChatGPT Operator copiou e-mails privados do Hacker News, e Microsoft Copilot forneceu links enganosos de sites de atacantes.

Minha responsabilidade era construir guardrails para prevenir ataques intencionais e resultados não intencionais. O design seguro de agentes começa com a compreensão do sistema. As defensas de nível de usuário envolvem listar ações possíveis e implementar autenticação, verificação de acesso e treinamento.

Restringir uploads ao SharePoint interno e aplicar treinamento de segurança mitiga riscos de conteúdo não confiável. As defensas de nível de sistema são o caminho mais eficaz, utilizando padrões de design arquitetônico para proteger agentes contra falhas e resultados adversos.