HeadlinesBriefing favicon HeadlinesBriefing.com

LLMウーターマークのAIエージェント行動への影響

Hacker News •
×

Anthropicは、将来のClaudeモデルがGoogle DeepMindのSynth ID-Textに基づく不可視のウーターマークを埋め込むと発表しました。このウーターマークは、EU AI ActのArticle 50(2)で合成テキストに要求されており、モデルのトーケン生成プロセスを変更します。モデルレベルでは、安全行動(有害なリクエストの拒否など)を変更し、プロンプトインジェクションに脆弱にする可能性があります。エージェントレベルでは、同じサンプリングされたトーケンが、どのツールが呼び出されるかと、どの引数が渡されるかを決定します。この行動効果は「サンプリングドリフト」と呼ばれ、モデルの拒否行動とエージェントのツール呼び出しの両方で確認されています。この効果はモデルとキーに依存し、集計スコアで隠される可能性があります。記事では、AIの安全性とセキュリティへの影響と、開発者何shoulddoについて議論しています。Anthropicの展開は、モデルレベルでウーターマークを適用し、Claude Platform APIとクラウドプロバイダー経由でアクセスされるサポートモデルをカバーし、これらのモデルに基づいて構築されたエージェントに関連するモデルレベルの行動効果を生み出します。Synth ID-Textによって使用されるトーナメントサンプリングは、モデルが不確実な場所でトーケン選択を変更する機会を更多与え、エージェントが実行する引数を潜在的に変更します。