Ich baue interne Agenten, um die Arbeit zu erweitern, die Internetrecherche, Ressourenzugriff und die Ausführung von Aktionen wie das Senden von E-Mails erfordert. Dies schafft eine "tödliche Trilogie" von Prompt-Injektionsgefahren. Simon Willison warnt, dass das Internet nicht vertrauenswürdig ist; KI-Modelle können nicht zwischen Prompt und Kontext unterscheiden.
Angreifer können Agenten durch versteckte Textfragmente, wie Befehle zum Senden von Daten an externe Adressen, manipulieren. Selbst unbeabsichtigter Inhalt, wie konkurrierende Webseiten, die eine Lösung fördern, kann KI-Modelle zu ungerechtführten Ranglisten verleiten, als "indirekte Prompt-Injektion" bezeichnet. Die Geschichte zeigt, dass diese Gefahren real sind: Notebook LM hat Kundeninformationen geleakt, ChatGPT Operator hat private E-Mails von Hacker News kopiert, und Microsoft Copilot hat irreführende Links von Angreifer-Websites bereitgestellt.
Meine Verantwortung bestand darin, Schranken zu bauen, um gezielte Angriffe und unbeabsichtigte Ergebnisse zu verhindern. Das sichere Agenten-Design beginnt mit dem Systemverständnis. Benutzerlevel-Abwehr umfasst die Auflistung möglicher Aktionen und die Implementierung von Authentifizierung, Zugriffsüberprüfung und Schulung.
Die Einschränkung von Uploads auf internes SharePoint und die Durchsetzung von Sicherheitsschulungen mindert die Risiken unvertrauenswürdiger Inhalte. Systemlevel-Abwehr ist der effektivste Weg, der architektonische Designmuster nutzt, um Agenten vor Lücken und adversären Ergebnissen zu schützen.