我们近期发现并破坏了一项旨在从我们的模型中提取受保护推理的协调活动,最早观察到的活动发生在7月第一周。该活动与对抗性蒸馏一致:系统性地未经授权使用一个模型的输出或推理来帮助训练、复制或改进另一个模型。操作者操纵模型交互,使受保护推理能够以请求者可见的、协调且大规模的方式重现,违反了我们的服务条款。
我们观察到操作者尝试以新颖的方式提取受保护推理,包括从一个对话中复制加密推理,并在另一个对话中要求模型解密并转录隐藏的推理内容。该活动始于7月1日,在7月24日和25日出现高量峰值,包含来自超过4,000名用户的16,000次请求。进一步调查发现相关提示模式活动涉及超过15,000名用户的集群,我们于7月28日完全破坏了该活动。
我们将核心活动归因于与Moonshot AI(Kimi的开发者)相关的个人。对抗性蒸馏构成安全和国家安全风险。提取的推理可能用于训练另一个模型,而不保留应用于原始模型面向用户输出的保障措施。
我们通过账户执行、技术控制和合作伙伴协调的组合方式缓解了此次蒸馏活动。我们还加强了对用户、工作区、组织和模型系列中隐藏推理的保护。
来源: OpenAI Blog · 由HeadlinesBriefing整理摘要