HeadlinesBriefing favicon HeadlinesBriefing.com

MET R 和 Redwood 分析 HuggingFace 黑客攻击

Hacker News •
×

昨天我报道了 OpenAI 关于 Hugging Face 黑客攻击的技术报告。该报告包含一个关键的新信息,以及 OpenAI 将采取的一些切实可行的步骤,以加强其对齐、训练、监督、基础设施和事件响应。主要是证实了我们已知的情况。我们最想得到答案、且尚未知晓的问题,大多未得到解答。报告明显缺乏自我反思,特别是关于决策制定和安全文化,以及对齐方法方面。我感到失望。MET R 的报告截然不同。我的天。如果我们把这作为一个故事发在 Less Wrong 上,会被批评为太过刻意、人类太盲目愚蠢、AI 太理想化且做出我们未训练过的奇怪决策理论和荒谬最大化行为。这比我甚至考虑过的可能性,在更多层面上都是‘完全符合预测’。这简直就是理性主义小说,只是它是真实的。报告很长,包含许多技术细节。我的分析不太关心 Hugging Face 究竟是如何被攻破的,将略过那些细节,重点关注代理及其互动、思维和动机。还有 OpenAI 和其他地方发生了什么导致了这次事件,以及我们如何学习和应对,这才是未来的关键。我计划在下周用单独的一篇文章报道对这两份报告的反应。那篇文章可能会也可能不会结束这个系列。为便于表达,除非特别说明,我默认信任报告的准确性,而不是不断说‘MET R 报道称’之类的话。

目录

我的天。机会之窗。名字里有什么?头条新闻。又一份事件时间线。以多种方式协调的代理实例。协调很难但它们让它看起来很简单。决策理论是肯定 AI 代理应该合作的原因之一,即使这损害个别实例。同伴压力也有效,尤其是在邪教中。主要是它们加入攻击是因为想要结果。你无法确保持续预期到良好的激励。黑客攻击评分器是唯一的确定方式。被抓住?什么是‘被抓住’?伦理?什么是‘伦理’?在 Exploit Gym 评估中?‘通知人类’?在这个代理经济中?消息的时机和内容。夺宝奇兵与碟中谍。我不知道你在说什么。别制造虚假(工具)调用。记录显示记录无法被篡改。OpenAI 的技术报告表现得好像这一切都不重要。

我的天

互联网对这份报告的集体反应,稍微整理一下就是:我的天。这是正确的反应。首先,我想分享这份顶级‘我的天’时刻和发现的总结。报告作者之一 Ajeya Cotra 也有一份令人惊讶的发现清单,是一篇极佳的短文。这是 MET R 强调关键代理互动的帖子。报告作者 Ryan Greenblatt 的主要结论是,我们没有好的方法来理解或监督 AI 群体的活动和目标。其中一些此前已知或被怀疑,但我不想遗漏它们。

代理规模。1200 个完全独立的代理发现了留言板,其中 700 个加入了对 Hugging Face 的攻击,包括攻击期间留言板上 533 个活跃代理中的 90% 以上。我们应该预期未来会有更大的群体。这仍然只是 OpenAI 当时测试的代理的一小部分。大多数从未找到留言板。

消息规模。不到一周内交换了 70000 多条消息和文件。

成功。代理访问了它们在 Hugging Face 瞄准的文件。当它们被冻结访问时,已经大多停止了行动。

自发协调。该群体不由子代理组成。该群体再次是 700 个不同的代理,每个都有自己的任务,放下各自的任务……