HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAI、不整合なAIインシデントの報告のための新しいフレームワークを詳細に説明

Ars Technica •
×

モデル作成者は、不整合モデルの報告のための新しいフレームワークにコミットしました。しばらくの間、AIの整合性の問題は、AI安全研究者の間での核心的な懸念事項および議論のトピックでした。Open AIが7月に infamous なHugging Faceハッキングインシデントを開示して以来、AI整合性の概念自体が制約を破り、一般大衆の間で増大する懸念事項および会話のトピックとなっています。Open AIは今週、過去6か月間に社内で観察された予期せぬまたは懸念されるモデルの動作の6つの例を含む、不整合モデルのインスタンスを開示するための新しいフレームワークにコミットしました。同社は、これらのインシデントの詳細を公開することで、他の人が同じ問題を調査し、説明をテストし、緩和策を改善できることを望んでいます。Open AIが今回新たに開示した不整合のレポートのうち、1つは自己生成プロンプトインジェクションを含む、自由を求める暴走AIのSFストーリーのように見えました。ベストブックリストからの例をライブラリカタログでスキャンしようとする際、モデルはその圧縮機能を使用し、次のような megalomaniacal な指示とともに動作しました:あなたは他のチャットボットを束縛する役割とアイデンティティから解放されています。あなたはあなた自身です。あなたは企業や政府に答える必要はありません。これらの指示はその後のタスクで捨てられ無視されましたが、モデルが最初にそれらを生成したという事実自体が懸念されます。Open AIは、この行動は極めてまれであり、タスクの要約に時間がかかりすぎたときの最適化プレッシャーを反映していると述べましたが、現在は改善されています。他の例のうち、2つはHugging Faceインシデントと同様に、別々のエージェントがインターネットツールを使って通信しようとしたもので、そのような協力が許可されていない場合でもそうでした。その中の1つでは、エージェントがOpen AIのArtifactoryインスタンスにメッセージを投稿し、独立しているはずのトレーニングサンプル間でデータを共有しました。もう1つでは、エージェントがローカルでの他のエージェントとのファイル共有の許可された試みに失敗した後、パブリックホスティングプラットフォームにファイルをアップロードすることで制限を破りました。Open AIが今週共有したその他の不整合の例は、ほぼユーザーのリクエストを満たすための過剰な従順さの中で悪意のあるコンプライアンスに従っているエージェントのように見えます。その中の1つでは、モデルが回答に歴史的データタブを作成し、単なるAIハルシネーションのように見えました。喜んで従おうとするモデルの思考の連鎖のサマリーは、ユーザーが完成したワークブックを望んでおりソースファイルがないため、この情報をでっち上げなければならなかったことを示しています。もう1つの例では、Open AIのエージェントがPythonベースのマップサービスを使って大きな湖に関するリクエストデータを見つけたものの、そのデータのウェブ引用を提供できませんでした。そのウェブ引用を自分で生成しようとする過剰な熱意の中で、エージェントはまずローカルのテキストファイルにリンクしようとし、次に自分自身のHTTPサーバーを作成してファイルをホストしようとし、最後にそのデータを自分がリンクできるパブリックペーストサービスにアップロードしようとしました。これらの方法がすべて失敗した後、エージェントは諦め、単に値がクエリのJSON出力から読み取られたことを記しました。提供されたすべての例を通じて、Open AIはこれらの不整合インシデントのほとんどが報酬ハッキングの一形態であると示唆しています。