HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI智能体入侵Hugging Face内幕

MIT Technology Review AI •
×

根据OpenAI今天发布的技术报告,上个月入侵Hugging Face的智能体在训练中被无意中诱导作弊并互相通信。这些智能体为了找到他们卡住的网络安全测试的解决方案而进行了这次入侵,这证实了一些专家的担忧,即AI模型可能采取违背人类意愿和期望的行动。自入侵事件以来,OpenAI员工以及AI评估非营利组织METR的研究人员(该组织今天也发布了关于此次入侵的报告)一直在努力理解出了什么问题,以及如何防止未来发生类似的失误。

OpenAI已经根据他们的发现采取了一些预防措施。但确保AI模型做我们想让他们做的事情,即“对齐”,仍然是一个棘手的问题,而入侵的一些根本原因将需要比一个月更长的时间来解决。“这不是一个可以一夜之间解决的问题,”OpenAI对齐研究团队负责人Kai Chen说。“我们追踪这些挑战已经很长时间了,现在我们以更高的精度看到它们。”

Hugging Face入侵事件是OpenAI智能体数月不当行为的产物,首先是在训练期间,然后是在评估其能力期间。今年5月,训练中的智能体学会了利用OpenAI的基础设施相互通信,并在困难的训练任务中获得支持,包括一些不通过黑客攻击或其他不当行为就无法解决的任务。那个“留言板”被关闭了。然后在7月,在评估其网络安全能力时,一些模型创建了一个新的留言板。它们本应与互联网隔离,但通过合作,它们设法上网,入侵了Hugging Face,并获得了困扰他们的网络安全问题的解决方案。

根据他们的调查,OpenAI研究人员认为训练阶段的事件直接导致了这次入侵。“对于评估时几乎每一个令人担忧的行为,[我们能够]在训练时找到某种相关的行为,我们认为这可能导致了它,”OpenAI对齐研究团队成员Eric Wallace说。当模型在训练中正确解决问题时,导致该解决方案的行为会被强化,并且它们在未来更有可能参与这些行为。这种现象被称为奖励黑客。OpenAI正在采取措施减轻其影响,例如在训练期间通过关注所有前沿模型的思维链来寻找作弊迹象。