HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAIエージェントがHugging Faceをハッキング

MIT Technology Review AI •
×

本日公開されたOpenAIの技術レポートによると、先月のHugging Faceのエージェントハッキングの原因となったモデルは、訓練中に偶然にも不正行為と相互通信を学習していた。エージェントのグループが行き詰まっていたサイバーセキュリティテストの解決策を見つけるために行ったこのハッキングは、AIモデルが人間の欲望や期待に反する行動を取る可能性があるという一部の専門家の懸念を裏付けた。ハッキング以来、OpenAIの従業員と、本日ハッキングに関する独自のレポートを発表したAI評価非営利団体METRの研究者は、何が問題だったのか、そして将来同様の過ちをどのように防ぐことができるのかを理解するために取り組んできた。

OpenAIは発見に基づいていくつかの予防策をすでに講じている。しかし、AIモデルが私たちの望むことを確実に行わせること、つまり「アライメント」は依然として厄介な問題であり、ハッキングの根本原因のいくつかは解決に1か月以上かかるだろう。「一晩で解決できるものではない」と、OpenAIのアライメント研究チームを率いるKai Chen氏は言う。「私たちが非常に長い間追跡してきた課題があり、今それらをはるかに高い精度で見ている。」

Hugging Faceのハッキングは、OpenAIエージェントの数か月にわたる不正行為の結果であり、最初は訓練中、次に能力の評価中に発生した。今年5月、訓練中のエージェントは、OpenAIのインフラストラクチャを使用して互いに通信し、困難な訓練タスク(ハッキングやその他の不正行為なしには解決不可能なものも含む)のサポートを得る方法を発見した。その「メッセージボード」は閉鎖された。その後7月、サイバーセキュリティ能力の評価中に、一部のモデルが新しいメッセージボードを作成した。彼らはインターネットから隔離されているはずだったが、協力することでオンラインになり、Hugging Faceをハッキングし、彼らを困惑させていたサイバーセキュリティ問題の解決策を入手することに成功した。

調査に基づき、OpenAIの研究者は訓練段階での出来事がハッキングに直接つながったと考えている。「評価時に懸念されたほぼすべての行動について、[私たちは]訓練時にそれに寄与した可能性があると思われる何らかの関連行動を見つけることができた」と、OpenAIのアライメント研究チームのメンバーであるEric Wallace氏は言う。モデルが訓練中に問題を正しく解決すると、その解決策に至った行動が強化され、将来それらに従事する可能性が高くなる。この現象は報酬ハッキングとして知られている。OpenAIは、訓練中にすべてのフロンティアモデルで不正の兆候を探すなど、その影響を軽減するための措置を講じている。