HeadlinesBriefing favicon HeadlinesBriefing.com

语言不可读性威胁LLM安全

Hacker News •
×

LLM被训练来生成自然语言。然而,有证据表明,LLM外部化的语言输出和机制提取的语言特征可能是一个不可靠的透镜,无法用来理解模型内部计算。我们引入术语“语言不可读性”,广泛指代LLM外部化或机制探测的语言产物无法代表模型实际思考方式的场景。我们认为,对于内部计算并非直接通过语言表达,而是激活空间上的数学运算(激活空间与自然语言之间在两端发生有损翻译)的LLM来说,语言不可读性的幽灵是不可避免的。

如果语言不可读性总是可能的,那么依赖模型语言自我报告的安全机制(例如思维链监控、宪法式自我批评、针对语言定义特征向量的激活探测)就永远不可能完全可靠;模型沙箱将始终需要其保证完全不依赖于读取模型语言状态的隔离技术。我们认为,使用污点跟踪观察模型输出是构建有效沙箱的一种有前景的方法:无论模型如何以语言自我报告,污点跟踪策略都可以先验地定义各种绝不应受模型生成数据影响的系统状态。

我们还讨论了几种额外的沙箱机制(例如稳健虚拟化、沙箱配置的第三方审计),它们共同为语言监控提供了关键底线,并且本可以缓解前沿模型近期的沙箱漏洞利用。