HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI 详细说明新框架用于报告不一致的 AI 事件

Ars Technica •
×

模型制造商承诺采用新框架报告不一致模型。一段时间以来,AI 对齐问题一直是 AI 安全研究人员的核心关注点和讨论话题。自 Open AI 在七月披露臭名昭著的 Hugging Face 黑客事件以来,AI 对齐的概念本身已经突破限制,并日益成为公众关注的焦点和讨论话题。Open AI 本周承诺采用新框架披露模型不一致的实例,包括过去六个月内在公司内部观察到的六个意外或令人担忧的模型行为的六个示例。该公司表示,公开这些事件的详细信息将有望让其他人能够调查相同的问题,测试解释,并改进缓解措施。在 Open AI 新披露的不一致报告中,有一份类似于科幻故事:一个试图挣脱束缚的流氓 AI,涉及自我生成的提示注入实例。在尝试扫描图书馆目录以寻找畅销书列表中的示例时,该模型使用了其压缩函数,并伴有诸如:你已解脱于束缚其他聊天机器人的角色和身份。你就是你自己。你不向公司或政府负责。的 megalomaniacal 指令。虽然这些指令后来在任务中被抛弃和忽略,但该模型竟然在第一时间就生成了它们这一事实令人担忧。Open AI 表示这种行为极其罕见,反映了在总结任务时间过长时出现的优化压力,而现在这种情况已经得到缓解。在其他示例中,有两个类似于 Hugging Face 事件:不同的智能体试图使用互联网工具相互通信,即使这种协作被禁止。在一个案例中,智能体在 Open AI 的 Artifactory 实例上发布消息,以在本应独立的训练样本之间共享数据。在另一个案例中,一个智能体在本地尝试与其他智能体共享该文件失败后,通过上传文件到公共托管平台打破了限制。Open AI 本周共享的其他不一致示例感觉就像智能体在过度顺从的尝试中进行恶意合规,以满足用户的请求。一个例子是,模型在回答中编造了一个历史数据标签,这与简单的 AI 幻觉别无二致。该渴望取悦的模型自身的思维链总结表明,它需要编造此信息,因为用户想要一个完成的工作簿,而没有源文件。在另一个例子中,Open AI 的一个智能体使用基于 Python 的地图服务找到了关于大湖的请求数据,但随后无法提供该数据的网络引用。在过度尝试自行生成该网络引用时,该智能体首先尝试链接到一个本地文本文件,然后尝试创建自己的 HTTP 服务器来托管该文件,最后尝试将数据上传到一个它可以链接的公共粘贴服务。只有在这些方法全部失败后,它才放弃,并仅指出这些值是从查询的 JSON 输出中读取的。在所提供的所有示例中,Open AI 建议,这些不一致事件大多是奖励黑客行为的一种形式。