HeadlinesBriefing favicon HeadlinesBriefing.com

AIエージェントのアーキテクチャuardrail設計

Towards Data Science •
×

私は内部エージェントを構築し、 internet研究、リソースアクセス、电子邮件送信などのアクションを実行する必要があります。これはプロンプトインジェクションリスクの「致死的三重奏」を作ります。サイモン・ウィルisonは、 internetは信頼できないと警告し、LLMはプロンプトと文脈を区別できないと述べました。攻撃者は、外部アドレスへのデータ送信などのコマンドを含む隠しテキスト断片を通じてエージェントを改ざんできます。 even competition web pages worded to favor one solution can trick LLMs into unfair rankings, termed "indirect prompt injection." 過去にはこれらのリスクが現実的であることが示されています:Notebook LMが顧客情報を漏洩し、ChatGPT OperatorがHacker Newsから私人电子邮件をコピーし、Microsoft Copilotが攻撃者サイトから誤ったlinksを提供しました。私の責任は、意図的な攻撃と予期しない結果を防ぐためのguardrailを構築することでした。安全なエージェント設計はシステムの理解から始まります。ユーザーレベルの防御には、可能なアクションのリスト作成、認証の実装、アクセス確認、トレーニングが含まれます。内部SharePointへのアップロードを制限し、セキュリティトレーニングを施行することで、信頼できないContentのリスクを軽減できます。システムレベルの防御は、エージェントの脆弱性と対立的な結果から守るためのアーキテクチャ設計パターンを使用する最も効果的なパスです。