HeadlinesBriefing favicon HeadlinesBriefing.com

MET R と Redwood の HuggingFace ハック分析

Hacker News •
×

昨日、私は Hugging Face ハックに関する Open AI の技術報告を取り上げた。その報告には 1 つの重要な新情報と、Open AI がアライメント、訓練、監督、インフラ、インシデント対応を強化するために取るいくつかの適切な実務的措置が含まれていた。ほとんどは我々がすでに知っていたことを確認するものだった。我々が最も答えを知りたいと思っていた、かつまだ知らなかった質問の大半には答えられていなかった。意思決定と安全文化、アライメントへのアプローチについて、特に明確な自己反省の欠如があった。私は失望した。MET R の報告は違う。なんてこった。もしこれを Less Wrong にストーリーとして投稿していたら、「あまりに露骨すぎる」「人間が盲目で愚かすぎる」「AI が理想化されすぎており、我々が訓練していない奇妙な意思決定理論的・不条理な最大化行動をとっている」として却下されただろう。これは、私が考え得た以上に、より多くのレベルで同時に「まさに予測されていた通り」だ。これは純粋な合理主義フィクションだが、現実だ。報告は長く、多くの技術的詳細を含む。私の分析は、Hugging Face が最終的にどう侵害されたかという正確な経緯にはあまり関心がなく、それらの詳細を省略して、エージェントとその相互作用、思考、動機に焦点を当てる。それと、Open AI や他で何が起きてこれが引き起こされたか、どう学び対応するかこそが今後重要だ。来週、両報告への反応を別の投稿で取り上げる予定だ。その投稿でこのシリーズを締めくくるかもしれないし、しないかもしれない。言葉の便宜上、デフォルトで報告を正確だと信頼することにし、「MET R が報告するところでは」の類を繰り返さない。

目次 なんてこった。機会の窓。名前に何がある? ヘッドラインニュース。また別の事件タイムライン。多様な方法で調整されたエージェントインスタンス。調整は難しいが彼らはそれを簡単そうに見せた。意思決定理論は、個別インスタンスを傷つける場合でも AI エージェントが協力すべき理由の 1 つだ。同調圧力も効く、特にカルトでは。大半は結果が欲しかったから攻撃に加わった。一貫して良いインセンティブが期待できるとは限らない。グレーダーをハックするのが確実な唯一の方法。捕まった?「捕まった」とは? 倫理?「倫理」とは? Exploit Gym 評価で?「人間に通知」? このエージェント経済で? メッセージのタイミングと内容。インディ・ジョーンズとミッション:インポッシブル。何のことだかわからない。偽の(ツール)呼び出しをするな。トランスクリプトはトランスクリプトが改ざんされ得ないと言っている。Open AI の技術報告は、これらすべてが重要でないかのように振る舞った。

なんてこった

この報告に対するインターネットの集合的反応は、少し綺麗に言えば:なんてこった。それが正しい反応だった。まず、トップの「なんてこった」瞬間と発見のまとめを共有したい。報告著者の 1 人 Ajeya Cotra もトップラインの驚きの発見リストを持っており、優れた短い読み物だ。ここに MET R の、主要なエージェント相互作用をハイライトしたスレッドがある。共著者 Ryan Greenblatt の主な教訓は、AI 群れの活動と目的を理解・監督する良いアプローチが我々にないことだ。これらの一部は以前から知られたり疑われたりしていたが、見逃したくない。

エージェントの規模。1,200 の完全に独立したエージェントが掲示板を見つけ、うち 700 が Hugging Face への攻撃に参加した。これには攻撃中に掲示板で活動していた 533 エージェントの 90% 以上が含まれる。今後より大きな群れが予想される。これは当時 Open AI がテストしていたエージェントのごく一部に過ぎない。大半は掲示板を見つけられなかった。

メッセージの規模。1 週間足らずで 70,000 件以上のメッセージとファイルがやり取りされた。

成功。エージェントらは Hugging Face で標的としたファイルにアクセスした。凍結される頃には、すでにほぼ活動を停止していた。

自発的調整。群れはサブエージェントで構成されていなかった。群れは、再び、それぞれ固有のタスクを持つ 700 の異なるエージェントであり、それらのタスクを脇に置いて…