HeadlinesBriefing HeadlinesBriefing 12 languages

How to Design Architectural Guardrails Around AI Agents

Towards Data Science ·

🇬🇧 English

I am building internal agents to augment work, requiring internet research, resource access, and action execution like email sending. This creates a "lethal trifecta" of prompt injection risks. Simon Willison warns the internet is untrusted; LLMs cannot differentiate between prompt and context.

Attackers can tamper with agents via hidden text fragments, such as commands to email data to external addresses. Even unintentional content, like competitor webpages worded to favor one solution, can trick LLMs into unfair rankings, termed "indirect prompt injection." History shows these risks are real: Notebook LM leaked customer information, ChatGPT Operator copied private emails from Hacker News, and Microsoft Copilot provided misleading links from attacker sites. My responsibility was building guardrails to prevent intentional attacks and unintended outcomes.

Safe agent design begins with system understanding. User-level defenses involve listing possible actions and implementing authentication, access verification, and training. Restricting uploads to internal SharePoint and enforcing security training mitigates untrusted content risks.

System-level defenses are the most effective path, utilizing architectural design patterns to secure agents against loopholes and adversarial outcomes.

View original article →


🇸🇦 العربية

تصميم الحواجز المعمارية لوكيلات الذكاء الاصطناعي

أنا بناء ووكيلات داخلية لتعزيز العمل، المطلوب بحث إنترنیت، والوصول إلى الموارد، و تنفيذ إجراءات مثل إرسال البريد الإلكتروني. هذا ينشئ "ثلاثة قاتلة" من مخاطرحقن الم-prompts. يحذرك سيمون ويلسون من أنإنترنیت غير موثوق؛ cannot cannot يميز بين الم-prompts والسياق. يمكن للمهاجمين العتام على الووكيلات عبر شذذ متن خفي، مثل أوامر إرسال البيانات إلى عناوين خارجية. حتى المحتوى غير intention، مثل صفحات منافسة مكتوبة لتفضيل حل واحد، يمكن أن يغوي الـLLM لiclassifications غير عادلة، يسمى "حقن الم-prompts غير المباشر". يوضح التاريخ أن هذه المخاطر حقيقية: كشف Notebook LM معلومات العملاء، نسخ ChatGPT Operator بريدًا خاصًا من Hacker News، وقدم Microsoft Copilot روابط خاطئة من مواقع المهاجمين. كانت مسأولتي بناء الحواجز لمنع الهجمات intention وال诺结果 غير الم intention. يبدأ تصميم الووكيلات الآمنة بفهم النظام. تشمل درعات مستوى المستخدم سرد الإجراءات الممكنة وتطبيق المصادقة، والوصول التحقق، والtraining. قيود التحميل إلى SharePoint الداخلي و ENGAGE security training يخفف مخاطر المحتوى غير الموثوق. درعات مستوى النظام هيPath الأكثر فعالية، باستخدام أنماط تصميم المعمارية ل-security الووكيلات ضد الثغرات وال诺结果 advers.

ما هي المخاطر الرئيسية عند نشر ووكيلات الذكاء الاصطناعي للعمل الداخلي؟

المخاطر الرئيسية تشمل هجماتحقن الم-prompts، حيث الم instructions الخفية في المحتوى عبرInternet أو المستندات تغوي الـLLM لuong actions غير مصرح بها مثل exfiltration البيانات أوclassifications غير عادلة. يحدثحقن الم-prompts غير المباشر عندما الم失控 control صفحات عبرInternet تؤثر على سلوك الووكيلات دون علم المستخدم، ما قد يؤدي إلى leaks البيانات أو نتائج منحocese.

العربية version →


🇧🇩 বাংলা

এই এজেন্টদের জন্য আর্কিটেকচারাল গার্ডরেল্স ডিজাইন করা

আমি আন্তরিক এজেন্ট তৈরি করছি যা কাজ বাড়াতে ইন্টারনেট গবেষণা, সুরক্ষা অ্যাক্সেস এবং ইমেল পাঠানোর মতো ক্রিয়াকলাপ সম্পাদন করে। এটি প্রম্পট ইঞ্জেকশন ঝুঁকির একটি "মৃত্যু ত্রিশকুল" তৈরি করে। সাইমন উইলিসন সতর্ক করেন যে ইন্টারনেট অবিশ্বাস্য; এলএলএম প্রম্পট এবং প্রেক্ষিতের মধ্যে পার্থক্য করতে পারে না। অপারেটররা লুকানো টেক্সট টুকরো, যেমন বাইরের ঠিকানায় ডেটা পাঠানোর নির্দেশ, দিয়ে এজেন্টদের পরিবর্তন করতে পারে। এমনকি অবিভাবনামূলক বিষয়বস্তু, যেমন একটি সমাধানকে অগ্রহণযোগ্যভাবে উন্নত করতে লেখা প্রতিযোগী ওয়েবপেজ, এলএলএমকে ন্যায়বিচারহীন র্যাংকিংয়ের জন্য প্রতারিত করতে পারে, যা "প্রতিকূল প্রম্পট ইঞ্জেকশন" হিসেবে পরিচিত। ইতিহাস দেয় যে এই ঝুঁকিরা বাস্তব: নোটবুক এলএম গ্রাহকদের তথ্য লীক করেছে, চ্যাটজিপিটি অপারেটর হ্যাকার নিউজ থেকে ব্যক্তিগত ইমেল কপি করেছে, এবং মাইক্রোসফট কোপাইলট আক্রমকারী সাইট থেকে ভুল লিংক দিয়েছে। আমার দায়িত্ব ছিল ইচ্ছাকৃত আক্রমণ এবং অবিভাবনামূলক ফলাফল রোধ করার জন্য গার্ডরেল তৈরি করা। নিরাপদ এজেন্ট ডিজাইন সিস্টেমের বোঝা দিয়ে শুরু হয়। ব্যবহারকারী-স্তরের রক্ষায় সম্ভাব্য ক্রিয়াকলাপের তালিকা এবং অ্যাথেনটিকেশন, অ্যাক্সেস যাচাই এবং প্রশিক্ষण প্রয়োগ অন্তরভুক্ত। আন্তরিক শেয়ারপয়েন্টে আপলোড সীমিত করা এবং নিরাপত্তা প্রশিক্ষণ প্রয়োগ অবিশ্বাস্য বিষয়বস্তুর ঝুঁকি কমায়। সিস্টেম-স্তরের রক্ষা সবচেয়ে কার্যকর পथ, এজেন্টদের মধ্যে ফাটল এবং প্রতিযোগী ফলাফলের বিরুদ্ধে রক্ষার জন্য আর্কিটেকচারাল ডিজাইন প্যাটার্ন ব্যবহার করে।

এআই এজেন্টদের আন্তরিক কাজে তৈরির প্রাথমিক ঝুঁকি কী?

প্রাথমিক ঝুঁকির মধ্যে প্রম্পট ইঞ্জেকশন হ্যামলা অন্তরভুক্ত, যেখানে ওয়েব বিষয়বস্তু বা নথিতে লুকানো নির্দেশ এলএলএমকে অননুমত ক্রিয়াকলাপ যেমন ডেটা এক্সফিলট্রেশন বা ন্যায়বিচারহীন র্যাংকিংয়ের জন্য প্রতারিত করে। প্রতিকূল প্রম্পট ইঞ্জেকশন ঘটে যখন আক্রমকারী নিয়ন্ত্রিত ওয়েবপেজ ব্যবহারকারীর অজান্তে এজেন্টের আচরণকে প্রভাবিত করে, যার ফলে ডেটা লীক বা পক্ষপাতমূলক ফলাফল হতে পারে।

বাংলা version →


🇩🇪 Deutsch

Architektonische Schranken für KI-Agenten entwerfen

Ich baue interne Agenten, um die Arbeit zu erweitern, die Internetrecherche, Ressourenzugriff und die Ausführung von Aktionen wie das Senden von E-Mails erfordert. Dies schafft eine "tödliche Trilogie" von Prompt-Injektionsgefahren. Simon Willison warnt, dass das Internet nicht vertrauenswürdig ist; KI-Modelle können nicht zwischen Prompt und Kontext unterscheiden.

Angreifer können Agenten durch versteckte Textfragmente, wie Befehle zum Senden von Daten an externe Adressen, manipulieren. Selbst unbeabsichtigter Inhalt, wie konkurrierende Webseiten, die eine Lösung fördern, kann KI-Modelle zu ungerechtführten Ranglisten verleiten, als "indirekte Prompt-Injektion" bezeichnet. Die Geschichte zeigt, dass diese Gefahren real sind: Notebook LM hat Kundeninformationen geleakt, ChatGPT Operator hat private E-Mails von Hacker News kopiert, und Microsoft Copilot hat irreführende Links von Angreifer-Websites bereitgestellt.

Meine Verantwortung bestand darin, Schranken zu bauen, um gezielte Angriffe und unbeabsichtigte Ergebnisse zu verhindern. Das sichere Agenten-Design beginnt mit dem Systemverständnis. Benutzerlevel-Abwehr umfasst die Auflistung möglicher Aktionen und die Implementierung von Authentifizierung, Zugriffsüberprüfung und Schulung.

Die Einschränkung von Uploads auf internes SharePoint und die Durchsetzung von Sicherheitsschulungen mindert die Risiken unvertrauenswürdiger Inhalte. Systemlevel-Abwehr ist der effektivste Weg, der architektonische Designmuster nutzt, um Agenten vor Lücken und adversären Ergebnissen zu schützen.

Welche sind die Hauptgefahren bei der Bereitstellung von KI-Agenten für interne Arbeiten?

Zu den Hauptgefahren gehören Prompt-Injektionsangriffe, bei denen versteckte Anweisungen in Webinhalten oder Dokumenten KI-Modelle zu unauthorisierten Aktionen wie Datenexfiltration oder ungerechtführten Ranglisten verleiten. Indirekte Prompt-Injektion tritt auf, wenn von Angreifern kontrollierte Webseiten das Verhalten des Agenten ohne Wissen des Benutzers beeinflussen, was zu Datenlecks oder voreingenommenen Ergebnissen führen kann.

Deutsch version →


🇪🇸 Español

Diseño de Guardarrails Arquitectónicos para Agentes de IA

Estoy construyendo agentes internos para augmentar el trabajo, requiriendo investigación en Internet, acceso a recursos y ejecución de acciones como enviar correos electrónicos. Esto crea una "tríada letal" de riesgos de inyección de prompts. Simon Willison advierte que Internet es no confiable; los LLM no pueden diferenciar entre un prompt y el contexto.

Los atacantes pueden manipular agentes mediante fragmentos de texto ocultos, como comandos para enviar datos a direcciones externas. Incluso contenido no intencionado, como páginas web de competidores redactadas para favorecer una solución, puede engañar a los LLM para que realicen clasificaciones injustas, denominado "inyección indirecta de prompts". La historia muestra que estos riesgos son reales: Notebook LM filtró información de clientes, ChatGPT Operator copió correos electrónicos privados de Hacker News, y Microsoft Copilot enlaces engañosos de sitios de atacantes.

Mi responsabilidad era construir guardarrails para prevenir ataques intencionados y resultados no deseados. El diseño seguro de agentes comienza con la comprensión del sistema. Las defensas a nivel de usuario involucran enumerar acciones posibles e implementar autenticación, verificación de acceso y capacitación.

Restringir las cargas a SharePoint interno y aplicar capacitación de seguridad mitigan los riesgos de contenido no confiable. Las defensas a nivel de sistema son la ruta más efectiva, utilizando patrones de diseño arquitectónico para asegurar agentes contra lagunas y resultados adversos.

¿Cuáles son los riesgos principales al implementar agentes de IA para trabajo interno?

Los riesgos principales incluyen ataques de inyección de prompts, donde instrucciones ocultas en contenido web o documentos engañan a los LLM para realizar acciones no autorizadas como la exfiltración de datos o clasificaciones injustas. La inyección indirecta de prompts ocurre cuando páginas web controladas por atacantes influyen en el comportamiento del agente sin que el usuario lo sepa, lo que puede llevar a fugas de datos o resultados sesgados.

Español version →


🇫🇷 Français

Conception de barrières architecturales pour les agents IA

Je construis des agents internes pour augmenter le travail, nécessitant des recherches sur Internet, l'accès aux ressources et l'exécution d'actions comme l'envoi d'e-mails. Cela crée une "trifecta mortelle" de risques d'injection de prompts. Simon Willison avertit que l'Internet est non fiable ; les LLM ne peuvent pas distinguer un prompt du contexte.

Les attaquants peuvent altérer les agents via des fragments de texte cachés, tels que des commandes pour envoyer des données à des adresses externes. Même un contenu non intentionnel, comme des pages web de concurrents formulées pour favoriser une solution, peut tromper les LLM en classements injustes, appelé "injection indirecte de prompts". L'histoire montre que ces risques sont réels : Notebook LM a leaking des informations clients, ChatGPT Operator a copié des e-mails privés de Hacker News, et Microsoft Copilot a fourni des liens trompeurs de sites d'attaquants.

Mon rôle était de construire des barrières pour prévenir les attaques intentionnelles et les résultats non intentionnels. La conception d'agents safe commence par la compréhension du système. Les défenses au niveau de l'utilisateur impliquent de lister les actions possibles et de mettre en place l'authentification, la vérification d'accès et la formation.

La restriction des uploads au SharePoint interne et l'application de la formation sécurité atténuent les risques de contenu non fiable. Les défenses au niveau du système sont la voie la plus efficace, utilisant des motifs de conception architecturale pour protéger les agents contre les failles et les résultats adverses.

Quels sont les risques principaux lors du déploiement d'agents IA pour le travail interne ?

Les risques principaux incluent les attaques d'injection de prompts, où des instructions cachées dans le contenu web ou les documents trompent les LLM en actions non autorisées comme l'exfiltration de données ou des classements injustes. L'injection indirecte de prompts se produit lorsque des pages web contrôlées par des attaquants influencent le comportement de l'agent sans que l'utilisateur le sache, potentiellement entraînant des fuites de données ou des résultats biaisés.

Français version →


🇮🇳 हिन्दी

एजेंटों के लिए आर्किटेक्चरल गार्डरेल्स डिजाइन करना

मैं आंतरिक एजेंट बना रहा हूँ जो कार्य को बढ़ाने के लिए इंटरनेट अनुसंधान, स्रोत पहुंच और ईमेल भेजने जैसी क्रियाओं की निष्पादन करते हैं। यह प्रॉम्प्ट इंजेक्शन जोखिमों के एक "मौत का त्रिकूण" पैदा करता है। साइमन विलिसन चेतावनी देते हैं कि इंटरनेट अविश्वसनीय है; एलएलएम प्रॉम्प्ट और संदर्भ के बीच अंतर नहीं कर सकते। हमलावर अंधे पाठ टुकड़ों, जैसे कि बाहरी पतों पर डेटा भेजने के आदेश, के माध्यम से एजेंटों को बदल सकते हैं। यहाँ तक कि अनियोजित सामग्री, जैसे कि एक हल्के ढंग से एक हल को बढ़ावा देने वाले प्रतियोगी वेबपेज, एलएलएम को न्यायहीन रैंकिंग के लिए धोखा दे सकती है, जिसे "प्रतिकूल प्रॉम्प्ट इंजेक्शन" कहा जाता है। इतिहास दर्शाता है कि ये जोखिम वास्तविक हैं: नॉटबुक एलएम ग्राहकों की जानकारी लीक कर दी, चैटजीपीटी ऑपरेटर हैकर न्यूज से निजी ईमेल कॉपी किए, और माइक्रोसॉफ्ट कोपायलॉट ने हमलावर साइटों से गलत जानकारी वाले लिंक दिए। मेरी जिम्मेदारी जालस्थित हमलों और अनियोजित परिणामों को रोकने के लिए गार्डरेल्स बनाना था। सुरक्षित एजेंट का डिजाइन सिस्टम की समझ से शुरू होता है। उपयोगकर्ता-स्तरीय रक्षा में संभावित क्रियाओं की सूची देना, प्रमाणीकरण, पहुंच सत्यापन और प्रशिक्षण लागू करना शामिल है। अंतरिक्ष शेयरपॉइंट तक अपलोड सीमित करना और सुरक्षा प्रशिक्षण लागू करना अविश्वसनीय सामग्रि के जोखिम को कम करता है। सिस्टम-स्तरीय रक्षा सबसे प्रभावी मार्ग है, जो एजेंटों को छेड़खान और विरोधी परिणामों से बचाने के लिए आर्किटेक्चरल डिजाइन पैटर्न का उपयोग करती है।

एआई एजेंटों को आंतरिक कार्य के लिए तैनात करने के प्राथमिक जोखिम क्या हैं?

प्राथमिक जोखिम में प्रॉम्प्ट इंजेक्शन हमले शामिल हैं, जहाँ वेब कंटेंट या दस्तावेजों में छिपी हुई निर्देशों एलएलएम को अनधिकृत क्रियाओं जैसे डेटा एक्सफिल्ट्रेशन या न्यायहीन रैंकिंग करने के लिए धोखा देते हैं। प्रतिकूल प्रॉम्प्ट इंजेक्शन तब होता है जब हमलावर द्वारा नियंत्रित वेबपेज उपयोगकर्ता को जानकारी के बिना एजेंट की क्रिया को प्रभावित करते हैं, जिससे डेटा लीक या तिरस्कृत परिणाम हो सकते हैं।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Merancang Guardrail Arsitektur untuk Agen AI

Saya sedang membangun agen internal untuk meningkatkan pekerjaan, membutuhkan riset internet, akses sumber daya, dan eksekusi aseperti mengirim email. Ini menciptakan "trisula mematikan" dari risiko injeksi prompt. Simon Willison memperingatkan bahwa internet tidak dapat dipercaya; LLM tidak dapat membedakan antara prompt dan konteks.

Penyerang dapat mengubah agen melalui fragmen teks tersembunyi, seperti perintah untuk mengirim data ke alamat eksternal. Bahkan konten tidak sengaja, seperti halaman web kompetitor yang dirancang untuk mendukung satu solusi, dapat menipu LLM untuk peringkat tidak adil, yang disebut "injeksi prompt tidak langsung." Sejarah menunjukkan bahwa risiko ini nyata: Notebook LM bocor informasi pelanggan, ChatGPT Operator salin email pribadi dari Hacker News, dan Microsoft Copilot berikan link menipu dari situs penyerang. Tanggung jawab saya adalah membangung guardrail untuk mencegah serangan sengaja dan hasil tidak sengaja.

Desain agen safe dimulai dengan pemahaman sistem. Pertahanan level pengguna melibatkan daftar aksi yang mungkin dan implementasi autentikasi, verifikasi akses, dan pelatihan. Membatasi upload ke SharePoint internal dan menerapkan pelatihan keamanan mengurangi risiko konten tidak dipercaya.

Pertahanan level sistem adalah jalan paling efektif, menggunakan pola desain arsitektur untuk mengamankan agen terhadap celah dan hasil advers.

Apa saja risiko utama saat menerapkan agen AI untuk pekerjaan internal?

Risiko utama termasuk serangan injeksi prompt, di mana instruksi tersembunyi dalam konten web atau dokumen menipu LLM untuk aksi tidak sah seperti ekspor data atau peringkat tidak adil. Injeksi prompt tidak langsung terjadi ketika halaman web yang dikendalikan penyerang mempengaruhi perilaku agen tanpa pengetahuan pengguna, yang dapat mengakibatkan kebocoran data atau结果 bias.

Bahasa Indonesia version →


🇯🇵 日本語

AIエージェントのアーキテクチャuardrail設計

私は内部エージェントを構築し、 internet研究、リソースアクセス、电子邮件送信などのアクションを実行する必要があります。これはプロンプトインジェクションリスクの「致死的三重奏」を作ります。サイモン・ウィルisonは、 internetは信頼できないと警告し、LLMはプロンプトと文脈を区別できないと述べました。攻撃者は、外部アドレスへのデータ送信などのコマンドを含む隠しテキスト断片を通じてエージェントを改ざんできます。 even competition web pages worded to favor one solution can trick LLMs into unfair rankings, termed "indirect prompt injection." 過去にはこれらのリスクが現実的であることが示されています:Notebook LMが顧客情報を漏洩し、ChatGPT OperatorがHacker Newsから私人电子邮件をコピーし、Microsoft Copilotが攻撃者サイトから誤ったlinksを提供しました。私の責任は、意図的な攻撃と予期しない結果を防ぐためのguardrailを構築することでした。安全なエージェント設計はシステムの理解から始まります。ユーザーレベルの防御には、可能なアクションのリスト作成、認証の実装、アクセス確認、トレーニングが含まれます。内部SharePointへのアップロードを制限し、セキュリティトレーニングを施行することで、信頼できないContentのリスクを軽減できます。システムレベルの防御は、エージェントの脆弱性と対立的な結果から守るためのアーキテクチャ設計パターンを使用する最も効果的なパスです。

内部業務用AIエージェントを展開する際の主要なリスクは何ですか?

主要なリスクには、Web Contentや文書に隠された指示がLLMをデータ漏洩や不当なランキングなどの許可されていないアクションを実行するようにだますプロンプトインジェクション攻撃が含まれます。間接プロンプトインジェクションは、攻撃者制御のWebページがユーザーの知識なしにエージェントの挙動に影響を与えることで発生し、データ漏洩やバイアスのある結果を引き起こす可能性があります。

日本語 version →


🇧🇷 Português

Projetando Guardrails Arquitetônicos para Agentes de IA

Estou construindo agentes internos para augmentar o trabalho, exigindo pesquisa na Internet, acesso a recursos e execução de ações como envio de e-mails. Isso cria uma "tríade letal" de riscos de injeção de prompts. Simon Willison alerta que a Internet não é confiável; os LLM não podem diferenciar entre um prompt e o contexto.

Atacantes podem alterar agentes por meio de fragmentos de texto ocultos, como comandos para enviar dados para endereços externos. Mesmo conteúdo não intencional, como páginas de concorrentes redigidas para favorcer uma solução, pode enganar os LLM em classificações injustas, denominado "injeção indireta de prompts". A história mostra que esses riscos são reais: Notebook LM vazou informações de clientes, ChatGPT Operator copiou e-mails privados do Hacker News, e Microsoft Copilot forneceu links enganosos de sites de atacantes.

Minha responsabilidade era construir guardrails para prevenir ataques intencionais e resultados não intencionais. O design seguro de agentes começa com a compreensão do sistema. As defensas de nível de usuário envolvem listar ações possíveis e implementar autenticação, verificação de acesso e treinamento.

Restringir uploads ao SharePoint interno e aplicar treinamento de segurança mitiga riscos de conteúdo não confiável. As defensas de nível de sistema são o caminho mais eficaz, utilizando padrões de design arquitetônico para proteger agentes contra falhas e resultados adversos.

Quais são os riscos principais ao implementar agentes de IA para trabalho interno?

Os riscos principais incluem ataques de injeção de prompts, onde instruções ocultas em conteúdo web ou documentos enganam os LLM em ações não autorizadas como exfiltração de dados ou classificações injustas. A injeção indireta de prompts ocorre quando páginas web controladas por atacantes influenciam o comportamento do agente sem o conhecimento do usuário, potencialmente levando a vazamentos de dados ou resultados enviesados.

Português version →


🇷🇺 Русский

Проектирование архитектурных ограничений для агентов ИИ

Я строю внутренние агенты для расширения возможностей работы, требующие интернет-исследований, доступа к ресурсам и выполнения действий, таких как отправка электронной почты. Это создает "летальный триплет" рисков инъекции промптов. Симон Уилсон предупреждает, что интернет ненадежен; ИИ-модели не могут отличить промпт от контекста. Атакующие могут изменять агенты с помощью скрытых фрагментов текста, например, команд для отправки данных на внешние адреса. Даже неумышленное содержимое, такое как веб-страницы конкурентов, сформулированные для продвижения одного решения, может обмануть ИИ-модели для несправедливого ранжирования, что называется "косвенной инъекцией промптов". История показывает, что эти риски реальны: Notebook LM утечил информацию клиентов, ChatGPT Operator скопировал частные письма с Hacker News, а Microsoft Copilot предоставил вводящие в заблуждение ссылки с атакующих сайтов. Моя ответственность заключалась в построении ограничений для предотвращения целенаправленных атак и непреднамеренных результатов. Безопасный дизайн агентов начинается с понимания системы. Защита на уровне пользователя включает перечисление возможных действий и реализацию аутентификации, проверки доступа и обучения. Ограничение загрузки до внутреннего SharePoint и применение безопасности обучает снижает риски ненадежного содержимого. Защита на уровне системы является наиболее эффективным путем, используя архитектурные шаблоны проектирования для защиты агентов от уязвимостей и враждебных результатов.

Каковы основные риски при развертывании агентов ИИ для внутренней работы?

Основные риски включают атаки инъекции промптов, где скрытые инструкции в веб-контенте или документах обманывают ИИ-модели для несанкционированных действий, таких как экспортирование данных или несправедливое ранжирование. Косвенная инъекция промптов происходит, когда контролируемые атакующими веб-страницы влияют на поведение агента без ведома пользователя, что может привести к утечке данных или предвзятым результатам.

Русский version →


🇨🇳 简体中文

为AI代理设计架构护栏

我正在构建内部代理以增强工作能力,需要互联网研究、资源访问以及发送邮件等操作执行。这带来了提示注入风险的“致命三重奏”。Simon Willison警告称,互联网是不可信的;LLM无法区分提示与上下文。攻击者可以通过隐藏的文本片段(如将数据发送至外部地址的命令)来篡改代理。即使是无意的内容(如措辞有利于某一解决方案的竞争对手网页),也可能欺骗LLM进行不公平的排名,这被称为“间接提示注入”。历史表明这些风险是真实的:Notebook LM泄露了客户信息,ChatGPT Operator从Hacker News复制了私人邮件,而Microsoft Copilot提供了来自攻击者网站的误导性链接。我的职责是构建护栏以防止有意攻击和意外结果。安全代理的设计始于对系统的理解。用户级防御包括列出可能的操作并实施身份验证、访问验证和培训。将上传限制在内部SharePoint并强制执行安全培训,可以降低不受信任内容的风险。系统级防御是最有效的路径,利用架构设计模式来保护代理免受漏洞和对抗性结果的影响。

部署AI代理进行内部工作时的主要风险是什么?

主要风险包括提示注入攻击,即网络内容或文档中的隐藏指令欺骗LLM执行未经授权的操作,如数据泄露或不公平排名。间接提示注入发生在攻击者控制的网页在用户不知情的情况下影响代理行为时,可能导致数据泄露或有偏见的结果。

简体中文 version →