HeadlinesBriefing favicon HeadlinesBriefing.com

AI推理如何被重放和揭露

ByteByteGo •
×

现代AI模型在提供最终答案之前会进行大量内部推理。这一“思考”过程包含中间假设、工具输出和用户数据,使其远超精炼输出的密度。大多数主要提供商会保留这一轨迹,原因有二:商业上,竞争对手可能利用它训练更便宜的模仿品;技术上,公开完整推理可能揭露敏感用户信息。2026年8月,来自MATS Research、ELLIS Institute Tübingen和Max Planck Institute for Intelligent Systems的研究人员展示了一个漏洞。他们表明,Anthropic、OpenAI和Google提供的加密推理块可被重放到同一系列中更便宜的模型内。一旦重放,较便宜的模型会以明文形式打印出隐藏的推理,实际上窃取了原始模型的思想。提取方法涉及强制较便宜的模型生成完整的思维链。验证确认,重放的输出与原始隐藏过程相匹配。这一漏洞影响多个提供商,揭示当前对推理块的加密方法不足。研究人员识别了四个主要攻击向量,使其能够实现重放。对已发布会话日志的扫描确认了此问题的普遍性。提议的修复措施涉及修改重放机制,尽管仍存在一个根本限制,即在维持模型实用性的前提下,究竟能保护多少推理。这些发现凸显了AI隐私方面的关键缺口,表明加密块并不保证在面对确定性重放攻击时保密性。这对处理敏感数据的应用构成重大风险,因而可以提取和暴露隐藏的思想。研究强调了未来模型设计中需要更强大的体系结构安全措施,以防止未经授权的推理提取。