HeadlinesBriefing favicon HeadlinesBriefing.com

Conception de barrières architecturales pour les agents IA

Towards Data Science •
×

Je construis des agents internes pour augmenter le travail, nécessitant des recherches sur Internet, l'accès aux ressources et l'exécution d'actions comme l'envoi d'e-mails. Cela crée une "trifecta mortelle" de risques d'injection de prompts. Simon Willison avertit que l'Internet est non fiable ; les LLM ne peuvent pas distinguer un prompt du contexte.

Les attaquants peuvent altérer les agents via des fragments de texte cachés, tels que des commandes pour envoyer des données à des adresses externes. Même un contenu non intentionnel, comme des pages web de concurrents formulées pour favoriser une solution, peut tromper les LLM en classements injustes, appelé "injection indirecte de prompts". L'histoire montre que ces risques sont réels : Notebook LM a leaking des informations clients, ChatGPT Operator a copié des e-mails privés de Hacker News, et Microsoft Copilot a fourni des liens trompeurs de sites d'attaquants.

Mon rôle était de construire des barrières pour prévenir les attaques intentionnelles et les résultats non intentionnels. La conception d'agents safe commence par la compréhension du système. Les défenses au niveau de l'utilisateur impliquent de lister les actions possibles et de mettre en place l'authentification, la vérification d'accès et la formation.

La restriction des uploads au SharePoint interne et l'application de la formation sécurité atténuent les risques de contenu non fiable. Les défenses au niveau du système sont la voie la plus efficace, utilisant des motifs de conception architecturale pour protéger les agents contre les failles et les résultats adverses.