HeadlinesBriefing favicon HeadlinesBriefing.com

AI水印与幻觉检测的冲突

Towards Data Science •
×

AI安全存在一个自相矛盾的问题。证明AI文本来源的技术正在削弱检查其真实性的技术。水印,即在生成的文本中嵌入隐藏签名,用于提高AI应用的透明度(欧洲的欧盟AI法案第50条;中国的AI标签法规)。此外,幻觉检测试图标记模型编造的答案部分。监管机构正在推动这两项技术,但AI模型内部在透明度与责任之间隐藏着冲突。

大型语言模型计算下一个标记的概率分布。有时该分布是尖锐的,比如在“法国的首都是”之后,“巴黎”是必然的。有时它是平坦的,多个续写同样可能。这种平坦度称为熵。这两项技术都存在于高熵位置。文本水印使用密钥偏置硬币翻转,如Kirchenbauer及其同事2023年的方案,将词汇分为绿色和红色列表。文本读起来自然,但包含更多绿色标记。

带有密钥的检测器计算绿色标记的数量并计算不可能性。Google DeepMind的Synth ID-Text,在Gemini模型中,使用锦标赛采样。无失真方案安排偏置,使输出分布平均不变。但水印只能在有空间的地方推动。在低熵位置,偏置会导致错误词语和质量崩溃。冲突隐藏在模型内部,但对AI安全有实际影响。

关键实体:公司:Google DeepMind | 人物:Kirchenbauer