HeadlinesBriefing favicon HeadlinesBriefing.com

Einfluss von LLM-Wasserzeichen auf AI-Agenten

Hacker News •
×

Ankündigte, dass zukünftige Claude-Modelle ein unsichtbares Wasserzeichen basierend auf Google DeepMinds Synth ID-Text einbetten werden. Dieses Wasserzeichen, das vom Artikel 50(2) des EU AI Act für synthetischen Text gefordert wird, verändert den Token-Generierungsprozess des Modells. Auf Modellebene kann dies Sicherheitsverhalten ändern, wie z.

B. gefährliche Anfragen abzulehnen, und sie für Prompt-Injection anfällig machen. Auf Agentenebene bestimmen dieselben sampled Tokens, welches Tool aufgerufen wird und welche Argumente übermittelt werden. Dieser Verhaltenseffekt, als Sampling-Drift bezeichnet, wird sowohl im Verweigerungsverhalten des Modells als auch im Tool-Aufruf des Agenten bestätigt.

Der Effekt ist modell- und schlüsselabhängig und kann durch aggregierte Scores verschleiert werden. Der Artikel diskutiert die Auswirkungen für die AI-Sicherheit und Sicherheit und was Entwickler tun sollten. Anthropic's Deployment wendet das Wasserzeichen auf Modellebene an, gestützte Modelle, die über die Claude Platform API und Cloud-Anbieter zugänglich sind, abdeckend, wodurch verhaltensbedingte Effekte auf Modellebene für Agenten, die um diese Modelle herum gebaut sind, relevant werden.

Tournament Sampling, das von Synth ID-Text verwendet hat, mehr Gelegenheit, Token-Auswahl zu verändern, wo das Modell unsicher ist, potenziell Argumente zu verändern, die ein Agent ausführt.