HeadlinesBriefing favicon HeadlinesBriefing.com

Impacto do Marcador de Água LLM no Comportamento do Agente de IA

Hacker News •
×

Annoncé que les futurs modèles Claude intégreront un filigrane invisible basé sur Synth ID-Text de Google DeepMind. Ce filigrane, requis par l'article 50(2) de la loi sur l'IA de l'UE pour le texte synthétique, altère le processus de génération de tokens du modèle. Au niveau du modèle, cela peut modifier les comportements de sécurité, comme refuser les demandes dangereuses, et les rendre vulnérables à l'injection de prompt.

Au niveau de l'agent, les mêmes tokens échantillonnés déterminent quel outil est appelé et quels arguments sont passés. Cet effet comportemental, appelé dérive d'échantillonnage, est confirmé à la fois dans le comportement de refus du modèle et dans l'appel d'outils de l'agent. L'effet dépend du modèle et de la clé et peut être masqué par les scores agrégés.

L'article discute des implications pour la sécurité et la sécurité de l'IA et ce que les développeurs devraient faire. Le déploiement d'Anthropic applique le filigrane au niveau du modèle, couvrant les modèles supportés accessibles via l'API Claude Platform et les fournisseurs cloud, rendant les effets comportementaux au niveau du modèle pertinents pour les agents construits autour de ces modèles. L'échantillonnage de tournoi, utilisé par Synth ID-Text, a plus d'opportunités d'altérer la sélection des tokens là où le modèle est incertain, potentiellement altérant les arguments qu'un agent exécute.