HeadlinesBriefing HeadlinesBriefing 12 languages

Understanding the Impact of LLM Watermarking on AI Agent Behavior

Hacker News ·

🇬🇧 English

Anthropic announced that future Claude models will embed an invisible watermark based on Google Deep Mind’s Synth ID-Text. This watermarking, required by Article 50(2) of the EU AI Act for synthetic text, alters the model’s token generation process. At the model level, this can change safety behaviors, such as refusing harmful requests, and make them vulnerable to prompt injection.

At the agent level, the same sampled tokens determine which tool is called and what arguments are passed. This behavioral effect, termed sampling drift, is confirmed in both model refusal behavior and agent tool calling. The effect is model- and key-dependent and can be obscured by aggregate scores.

The article discusses the implications for AI safety and security and what developers should do. Anthropic’s deployment applies the watermark at the model level, covering supported models accessed through the Claude Platform API and cloud providers, making model-level behavioral effects relevant to agents built around these models. Tournament sampling, used by Synth ID-Text, has more opportunity to alter token selection where the model is uncertain, potentially altering arguments that an agent executes.

View original article →


🇸🇦 العربية

تأثير العلامة المائية للـ LLM على سلوك الوكلاء الذهنيين

أعلنت Anthropic أن نماذج Claude未来将嵌入基于Google DeepMind的Synth ID-Text的隐形水印。 هذه العلامة المائية، المطلوبة بموجب Article 50(2) من EU AI Act للنص الاصطناعي، تغير عملية توليد الرموز للنمودج. على مستوى النمودج، يمكن أن تتغير سلوكات الأمان، مثل رفض طلبات ضارة، وتصبح عرضة لحقن الموجهات. على مستوى الوكيل، تحدد الرموز الم Samplingة التي أُ取ت أي أداة يتم استدعاؤها وأي معطيات تُمرر. يُسمى هذا التأثير السلوكي "انزياح العينات"، وتم تأكيده في كل من سلوك رفض النمودج واستcalls الأدوات من الوكيل. هذا التأثير يعتمد على النمودج والمفتاح، وي يمكن أن يُخفى بالدرجات التراكمية. ي discusses المقال implications for AI safety and security and what developers should do. تطبيقات Anthropic تطبق العلامة المائية على مستوى النمودج، وتغطي النماذج المدعم accessed من خلال Claude Platform API وviders cloud، مما يجعل تأثيرات سلوك النمودج على مستوى النمودج ذات ص relevance للوكلاء المبنيين حول هذه النماذج. عينات المباريات، المستخدمة في Synth ID-Text، لها فرصة أكبر لتغيير اختيار الرموز حيث يكون النمودج غير مطمئن، مما قد يغير المعطيات التي ي executes الوكيل.

ما هي ضريبة الأصل؟

ضريبة الأصل هي التأثير السلوكي للemarka المائية للـ LLM على سلوك الوكلاء الذهنيين، حيث تغير عملية العلامة المائية توليد الرموز للنمودج، مما قد يؤثر على ما يقوله النمودج وعلى ما يفعله الوكيل.

العربية version →


🇧🇩 বাংলা

এলএলএম ওয়াটারমার্কিং-এর আইএ এজেন্ট আচরণের উপর প্রভাব

অ্যান্থ্রোপিক ঘোষণা করেছে যে ভবিষ্যের ক্লোড মডেলগুলো গুগল ডিপমাইন্ডের সিন্থ আইডি-টেক্স্টের ভিত্তিতে অদৃশ্য ওয়াটারমার্ক ব্যবহার করবে। এই ওয়াটারমার্কিং, যা ইউরোপিইন ইউনিয়নের আইএ আইনের ৫০(২) নম্বর আর্টিকেল দ্বারা সিন্থেটিক টেক্স্টের জন্য প্রয়োজনীয়, মডেলের টোকেন জেনারেশন প্রক্রিয়া পরিবর্তন করে। মডেল স্তরে, এটি নিরাপত্তার আচরণ পরিবর্তন করতে পারে, যেমন ক্ষতিকর অনুরোধ প্রত্যাখ্যান করা, এবং এগুলোকে প্রম্পট ইনজেকশনের জন্য ঝুঁকিতে ফেলতে পারে। এজেন্ট স্তরে, একই স্যাম্পল করা টোকেন নির্ধারণ করে যে কোন টুল কল করা হয় এবং কী যুক্তিসমূহ পাঠানো হয়। এই আচরণগত প্রভাকে স্যাম্পলিং ড্রিফ্ট বলা হয়, এবং এটি মডেলের প্রত্যাখ্যান আচরণ এবং এজেন্টের টুল কল উভয়ের মধ্যে নিশ্চিত হয়েছে। এই প্রভাব মডেল এবং কী-র উপর নির্ভরশীল এবং একত্রীকৃত স্কোরের দ্বারা অন্ধকার করা যেতে পারে। আর্টিকেলটি আইএ নিরাপত্তা এবং নিরাপত্তার জন্য অর্থহীনতা এবং ডেভেলপারদের কী করা উচিত তা আলোচনা করে। অ্যান্থ্রোপিকের ডিপ্লয়মেন্ট মডেল স্তরে ওয়াটারমার্ক প্রয়োগ করে, যা ক্লোড প্লাটফর্ম এপিএ এবং ক্ল৉ড প্রদাতাদের মাধ্যমে অ্যাক্সেস করা সমর্থিত মডেলগুলোকে আবৃত করে, যা মডেল স্তরের আচরণগত প্রভাবকে এই মডেলগুলোর চারোদিকে তৈরি করা এজেন্টদের জন্য প্রাসঙ্গিক করে। সিন্থ আইডি-টেক্স্ট দ্বারা ব্যবহৃত টুর্নামেন্ট স্যাম্পলিং, মডেল যেখানে অনিশ্চিত সেখানে টোকেন নির্বাচন পরিবর্তনের সুযোগ বেশি করে, যা একটি এজেন্ট যে যুক্তিসমূহ নির্বাহ করে তা পরিবর্তন করতে পারে।

প্রোভেনেন্স ট্যাক্স কী?

প্রোভেনেন্স ট্যাক্স হলো এলএলএম ওয়াটারমার্কিং-এর আইএ এজেন্ট আচরণের উপর আচরণগত প্রভাব, যেখানে ওয়াটারমার্কিং প্রক্রিয়া মডেলের টোকেন জেনারেশন পরিবর্তন করে, যা মডেলের কथন এবং এজেন্টের কর্ম উভয়কেই প্রভাবিত করতে পারে।

বাংলা version →


🇩🇪 Deutsch

Einfluss von LLM-Wasserzeichen auf das Verhalten von AI-Agenten

Ankündigte, dass zukünftige Claude-Modelle ein unsichtbares Wasserzeichen basierend auf Google DeepMinds Synth ID-Text einbetten werden. Dieses Wasserzeichen, das vom Artikel 50(2) des EU AI Act für synthetischen Text gefordert wird, verändert den Token-Generierungsprozess des Modells. Auf Modellebene kann dies Sicherheitsverhalten ändern, wie z.

B. gefährliche Anfragen abzulehnen, und sie für Prompt-Injection anfällig machen. Auf Agentenebene bestimmen dieselben sampled Tokens, welches Tool aufgerufen wird und welche Argumente übermittelt werden. Dieser Verhaltenseffekt, als Sampling-Drift bezeichnet, wird sowohl im Verweigerungsverhalten des Modells als auch im Tool-Aufruf des Agenten bestätigt.

Der Effekt ist modell- und schlüsselabhängig und kann durch aggregierte Scores verschleiert werden. Der Artikel diskutiert die Auswirkungen für die AI-Sicherheit und Sicherheit und was Entwickler tun sollten. Anthropic's Deployment wendet das Wasserzeichen auf Modellebene an, gestützte Modelle, die über die Claude Platform API und Cloud-Anbieter zugänglich sind, abdeckend, wodurch verhaltensbedingte Effekte auf Modellebene für Agenten, die um diese Modelle herum gebaut sind, relevant werden.

Tournament Sampling, das von Synth ID-Text verwendet hat, mehr Gelegenheit, Token-Auswahl zu verändern, wo das Modell unsicher ist, potenziell Argumente zu verändern, die ein Agent ausführt.

Was ist die Provenance Tax?

Die Provenance Tax bezieht sich auf den Verhaltenseffekt von LLM-Wasserzeichen auf das Verhalten von AI-Agenten, wobei der Wasserzeichen-Prozess die Token-Generierung des Modells verändert, was potenziell sowohl beeinflusst, was das Modell sagt, als auch was ein Agent tut.

Deutsch version →


🇪🇸 Español

Impacto del Marcado de Agua en el Comportamiento de los Agentes de IA

Anunció que los modelos futuros de Claude incrustarán una marca de agua invisible basada en Synth ID-Text de Google DeepMind. Esta marca de agua, requerida por el artículo 50(2) de la Ley de IA de la UE para texto sintético, altera el proceso de generación de tokens del modelo. A nivel de modelo, esto puede cambiar los comportamientos de seguridad, como rechazar solicitudes peligrosas, y hacerlos vulnerables a la inyección de indicaciones.

A nivel de agente, los mismos tokens muestreados determinan qué herramienta se llama y qué argumentos se pasan. Este efecto comportamental, denominado deriva de muestreo, se confirma tanto en el comportamiento de rechazo del modelo como en la llamada de herramientas del agente. El efecto depende del modelo y la clave y puede ser oculto por las puntuaciones agregadas.

El artículo discute las implicaciones para la seguridad y seguridad de la IA y lo que deben hacer los desarrolladores. La implementación de Anthropic aplica la marca de agua a nivel de modelo, cubriendo los modelos admitidos accedidos a través de la API de la Plataforma Claude y los proveedores de nube, haciendo que los efectos comportamentales a nivel de modelo sean relevantes para los agentes construidos alrededor de estos modelos. El muestreo de torneos, utilizado por Synth ID-Text, tiene más oportunidades de alterar la selección de tokens donde el modelo está incierto, potencialmente alterando los argumentos que ejecuta un agente.

¿Qué es el Impuesto de Procedencia?

El Impuesto de Procedencia se refiere al efecto comportamental del marcado de agua de LLM en el comportamiento de los agentes de IA, donde el proceso de marcado de agua altera la generación de tokens del modelo, afectando potencialmente tanto lo que dice el modelo como lo que hace un agente.

Español version →


🇫🇷 Français

Impacto do Marcador de Água LLM no Comportamento do Agente de IA

Annoncé que les futurs modèles Claude intégreront un filigrane invisible basé sur Synth ID-Text de Google DeepMind. Ce filigrane, requis par l'article 50(2) de la loi sur l'IA de l'UE pour le texte synthétique, altère le processus de génération de tokens du modèle. Au niveau du modèle, cela peut modifier les comportements de sécurité, comme refuser les demandes dangereuses, et les rendre vulnérables à l'injection de prompt.

Au niveau de l'agent, les mêmes tokens échantillonnés déterminent quel outil est appelé et quels arguments sont passés. Cet effet comportemental, appelé dérive d'échantillonnage, est confirmé à la fois dans le comportement de refus du modèle et dans l'appel d'outils de l'agent. L'effet dépend du modèle et de la clé et peut être masqué par les scores agrégés.

L'article discute des implications pour la sécurité et la sécurité de l'IA et ce que les développeurs devraient faire. Le déploiement d'Anthropic applique le filigrane au niveau du modèle, couvrant les modèles supportés accessibles via l'API Claude Platform et les fournisseurs cloud, rendant les effets comportementaux au niveau du modèle pertinents pour les agents construits autour de ces modèles. L'échantillonnage de tournoi, utilisé par Synth ID-Text, a plus d'opportunités d'altérer la sélection des tokens là où le modèle est incertain, potentiellement altérant les arguments qu'un agent exécute.

Qu'est-ce que l'impôt de provenance?

L'impôt de provenance fait référence à l'effet comportemental du filigrane LLM sur le comportement de l'agent de IA, où le processus de filigrane altère la génération de tokens du modèle, affectant potentiellement à la fois ce que le modèle dit et ce que l'agent fait.

Français version →


🇮🇳 हिन्दी

एलएलएम वॉटरमार्किंग का एआई एजेंट व्यवहार पर प्रभाव

एंथ्रोपिक ने घोषणा की कि भविष्य के क्लॉड मॉडल Google DeepMind के Synth ID-Text आधारित अदृश्य वॉटरमार्क एम्बेड करेंगे। यह वॉटरमार्किंग, जो संयुक्त राज्य अमेरिका के एआई ऐक्ट के आर्टिकल 50(2) द्वारा संथेटिक टेक्स्ट के लिए आवश्यक है, मॉडल की टोकन जनरेशन प्रक्रिया को बदलती है। मॉडल स्तर पर, यह सुरक्षा व्यवहारों को बदल सकता है, जैसे कि हानिकारक अनुरोधों को अस्वीकार करना, और इन्हें प्रॉमप्ट इंजेक्शन के लिए वुलनर बना सकता है। एजेंट स्तर पर, समान सैंपल किए गए टोकन यह तय करते हैं कि किस टूल को कॉल किया जाता है और कौन से तर्क पास किए जाते हैं। इस व्यवहारिक प्रभाव को सैंपलिंग ड्रिफ्ट कहा जाता है, जिसकी पुष्टि मॉडल इनकार व्यवहार और एजेंट टूल कॉलिंग दोनों में की गई है। यह प्रभाव मॉडल और कुंजी के अनुरूप है और इसे एकत्रित स्कोर्स द्वारा अंधेरा किया जा सकता है। लेख में एआई सुरक्षा और सुरक्षा के लिए असरों और डेवलपर्स को क्या करना चाहिए पर चर्चा की गई है। एंथ्रोपिक की तैनाती वॉटरमार्क को मॉडल स्तर पर लागू करती है, जो क्लॉड प्लेटफार्म API और क्लाउड प्रदाताओं के माध्यम से पहुंचे जाने वाले समर्थित मॉडल्स को कवर करती है, जिससे मॉडल स्तर के व्यवहारिक प्रभाव इन मॉडल्स के चारों ओर बनाए गए एजेंट्स के लिए प्रासंगिक हो जाते हैं। सिंथ आईडी-टेक्स्ट द्वारा उपयोग किया जाने वाला टूर्नामेंट सैंपलिंग, जहां मॉडल अनिश्चित होता है, वहां टोकन चुनने के अवसर बढ़ाता है, जो एजेंट द्वारा कार्यान्वित तर्कों को बदल सकता है।

प्रोवेनेंस टैक्स क्या है?

प्रोवेनेंस टैक्स से तात्पर्य एलएलएम वॉटरमार्किंग का एआई एजेंट व्यवहार पर व्यवहारिक प्रभाव है, जहां वॉटरमार्किंग प्रक्रिया मॉडल की टोकन जनरेशन को बदलती है, जो मॉडल की बातों और एजेंट के कार्यों दोनों को प्रभावित कर सकती है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Dampak Watermarking LLM pada Perilaku Agen AI

Mengumumkan bahwa model Claude masa depan akan menanamkan watermark tidak berdasarkan Synth ID-Text dari Google DeepMind. Watermark ini, yang diperlukan oleh Article 50(2) dari EU AI Act untuk teks sintetik, mengubah proses generasi token model. Pada level model, ini dapat mengubah perilaku keamanan, seperti menolak permintaan berbahaya, dan membuatnya rentan terhadap injeksi prompt.

Pada level agen, token yang sama yang diambil menentukan mana alat yang dipanggil dan apa argumen yang dilewatkan. Efek perilaku ini, yang disebut sampling drift, dikonfirmasi dalam perilaku penolakan model dan pemanggilan alat agen. Efek ini tergantung pada model dan kunci dan dapat disembunyikan oleh skor aggregate.

Artikel ini membahas implikasi untuk keamanan dan keamanan AI dan apa yang harus dilakukan pengembang. Deploymen Anthropic mengaplikasikan watermark pada level model, mencakup model yang didukung yang diakses melalui Claude Platform API dan penyedia cloud, membuat efek perilaku level model relevan untuk agen yang dibangun di sekitar model-model ini. Tournament sampling, yang digunakan oleh Synth ID-Text, memiliki lebih banyak kesempatan untuk mengubah pemilihan token di mana model tidak pasti, yang secara potensial mengubah argumen yang dieksekusi oleh agen.

Apa itu Provenance Tax?

Provenance Tax merujuk pada efek perilaku dari watermarking LLM pada perilaku agen AI, di mana proses watermarking mengubah generasi token model, yang secara potensial memengaruhi baik apa yang dikatakan model maupun apa yang dilakukan agen.

Bahasa Indonesia version →


🇯🇵 日本語

LLMウーターマークのAIエージェント行動への影響

Anthropicは、将来のClaudeモデルがGoogle DeepMindのSynth ID-Textに基づく不可視のウーターマークを埋め込むと発表しました。このウーターマークは、EU AI ActのArticle 50(2)で合成テキストに要求されており、モデルのトーケン生成プロセスを変更します。モデルレベルでは、安全行動(有害なリクエストの拒否など)を変更し、プロンプトインジェクションに脆弱にする可能性があります。エージェントレベルでは、同じサンプリングされたトーケンが、どのツールが呼び出されるかと、どの引数が渡されるかを決定します。この行動効果は「サンプリングドリフト」と呼ばれ、モデルの拒否行動とエージェントのツール呼び出しの両方で確認されています。この効果はモデルとキーに依存し、集計スコアで隠される可能性があります。記事では、AIの安全性とセキュリティへの影響と、開発者何shoulddoについて議論しています。Anthropicの展開は、モデルレベルでウーターマークを適用し、Claude Platform APIとクラウドプロバイダー経由でアクセスされるサポートモデルをカバーし、これらのモデルに基づいて構築されたエージェントに関連するモデルレベルの行動効果を生み出します。Synth ID-Textによって使用されるトーナメントサンプリングは、モデルが不確実な場所でトーケン選択を変更する機会を更多与え、エージェントが実行する引数を潜在的に変更します。

Provenance Taxは何ですか?

Provenance Taxは、LLMウーターマークのAIエージェント行動への行動効果を指し、ウーターマークプロセスがモデルのトーケン生成を変更し、モデルが何を言うかとエージェントが何をするかの両方を潜在的に影響します。

日本語 version →


🇧🇷 Português

Impacto da Marcador de Água LLM no Comportamento do Agente de IA

Anunciou que os futuros modelos Claude incorporarão uma marca d'água invisível baseada no Synth ID-Text do Google DeepMind. Esta marca d'água, exigida pelo Artigo 50(2) da Lei de IA da UE para texto sintético, altera o processo de geração de tokens do modelo. No nível do modelo, isso pode alterar comportamentos de segurança, como recusar pedidos perigosos, e torná-los vulneráveis a injeção de prompts.

No nível do agente, os mesmos tokens amostrados determinam qual ferramenta é chamada e quais argumentos são passados. Este efeito comportamental, chamado de derivação de amostragem, é confirmado tanto no comportamento de recusa do modelo quanto na chamada de ferramentas do agente. O efeito depende do modelo e da clave e pode ser obscurecido por pontuações agregadas.

O artigo discute as implicações para a segurança e segurança da IA e o que os desenvolvedores devem fazer. A implantação da Anthropic aplica a marca d'água no nível do modelo, cobrindo os modelos suportados acessados através da API da Plataforma Claude e provedores de nuvem, tornando os efeitos comportamentais no nível do modelo relevantes para agentes construídos em torno desses modelos. A amostragem de torneio, usada pelo Synth ID-Text, tem mais oportunidades de alterar a seleção de tokens onde o modelo é incerto, potencialmente alterando os argumentos que um agente executa.

O que é o Imposto de Procedência?

O Imposto de Procedência refere-se ao efeito comportamental da marca d'água LLM no comportamento do agente de IA, onde o processo de marca d'água altera a geração de tokens do modelo, afetando potencialmente tanto o que o modelo diz quanto o que o agente faz.

Português version →


🇷🇺 Русский

Влияние водяных знаков LLM на поведение агентов ИИ

Объявил, что будущие модели Claude будут встраивать невидимый водяной знак, основанный на Synth ID-Text от Google DeepMind. Этот водяной знак, требуемый статьей 50(2) Закона об ИИ ЕС для синтетического текста, изменяет процесс генерации токенов модели. На уровне модели это может изменить поведение в области безопасности, например, отказ от опасных запросов, и сделать их уязвимыми к инъекции промптов. На уровне агента те же сами токены определяют, какой инструмент вызывается и какие аргументы передаются. Это поведенческий эффект, названный дрейфом выборки, подтверждается как в поведении модели при отказе, так и в вызове инструментов агента. Эффект зависит от модели и ключа и может быть замаскирован агрегированными баллами. Статья обсуждает последствия для безопасности ИИ и безопасности и то, что должны делать разработчики. Развертывание Anthropic применяет водяной знак на уровне модели, охватывая поддерживаемые модели, доступные через API Claude Platform и облачных провайдеров, делая поведенческие эффекты на уровне модели релевантными для агентов, построенных вокруг этих моделей. Tournament sampling, используемый Synth ID-Text, имеет больше возможностей изменить выбор токенов там, где модель не уверена, потенциально изменяя аргументы, которые выполняет агент.

Что такое Provenance Tax?

Provenance Tax относится к поведенческому эффекту водяных знаков LLM на поведение агентов ИИ, где процесс водяных знаков изменяет генерацию токенов модели, потенциально влияя как на то, что модель говорит, так и на то, что делает агент.

Русский version →


🇨🇳 简体中文

LLM水印对AI智能体行为的影响

Anthropic宣布,未来的Claude模型将嵌入基于Google DeepMind的Synth ID-Text的隐形水印。这种水印是欧盟AI法案第50(2)条对合成文本的要求,它改变了模型的token生成过程。在模型层面,这可能会改变安全行为,例如拒绝有害请求,并使它们容易受到提示注入的攻击。在智能体层面,相同的采样token决定了调用哪个工具以及传递什么参数。这种行为效应被称为采样漂移,在模型拒绝行为和智能体工具调用中都得到了证实。该效应取决于模型和密钥,并且可能被聚合分数掩盖。本文讨论了对AI安全和安全的影响以及开发人员应该采取的措施。Anthropic的部署在模型级别应用水印,覆盖通过Claude Platform API和云提供商访问的受支持模型,使模型级别的行为效应与围绕这些模型构建的智能体相关。Synth ID-Text使用的锦标赛采样在模型不确定的地方有更多机会改变token选择,可能改变智能体执行的参数。

什么是溯源税?

溯源税是指LLM水印对AI智能体行为的行为效应,其中水印过程改变了模型的token生成,可能影响模型所说的内容以及智能体所做的事。

简体中文 version →