HeadlinesBriefing favicon HeadlinesBriefing.com

Влияние водяных знаков LLM на поведение агентов ИИ

Hacker News •
×

Объявил, что будущие модели Claude будут встраивать невидимый водяной знак, основанный на Synth ID-Text от Google DeepMind. Этот водяной знак, требуемый статьей 50(2) Закона об ИИ ЕС для синтетического текста, изменяет процесс генерации токенов модели. На уровне модели это может изменить поведение в области безопасности, например, отказ от опасных запросов, и сделать их уязвимыми к инъекции промптов. На уровне агента те же сами токены определяют, какой инструмент вызывается и какие аргументы передаются. Это поведенческий эффект, названный дрейфом выборки, подтверждается как в поведении модели при отказе, так и в вызове инструментов агента. Эффект зависит от модели и ключа и может быть замаскирован агрегированными баллами. Статья обсуждает последствия для безопасности ИИ и безопасности и то, что должны делать разработчики. Развертывание Anthropic применяет водяной знак на уровне модели, охватывая поддерживаемые модели, доступные через API Claude Platform и облачных провайдеров, делая поведенческие эффекты на уровне модели релевантными для агентов, построенных вокруг этих моделей. Tournament sampling, используемый Synth ID-Text, имеет больше возможностей изменить выбор токенов там, где модель не уверена, потенциально изменяя аргументы, которые выполняет агент.