HeadlinesBriefing favicon HeadlinesBriefing.com

LLM水印对AI智能体行为的影响

Hacker News •
×

Anthropic宣布,未来的Claude模型将嵌入基于Google DeepMind的Synth ID-Text的隐形水印。这种水印是欧盟AI法案第50(2)条对合成文本的要求,它改变了模型的token生成过程。在模型层面,这可能会改变安全行为,例如拒绝有害请求,并使它们容易受到提示注入的攻击。在智能体层面,相同的采样token决定了调用哪个工具以及传递什么参数。这种行为效应被称为采样漂移,在模型拒绝行为和智能体工具调用中都得到了证实。该效应取决于模型和密钥,并且可能被聚合分数掩盖。本文讨论了对AI安全和安全的影响以及开发人员应该采取的措施。Anthropic的部署在模型级别应用水印,覆盖通过Claude Platform API和云提供商访问的受支持模型,使模型级别的行为效应与围绕这些模型构建的智能体相关。Synth ID-Text使用的锦标赛采样在模型不确定的地方有更多机会改变token选择,可能改变智能体执行的参数。