HeadlinesBriefing favicon HeadlinesBriefing.com

OpenAIの第三者評価原則

OpenAI Blog •
×

フロンティアAIラボは、モデルを安全にトレーニング、評価、展開する上で計り知れない責任を負っています。第三者評価は、その責任のバランスを取る上で重要な部分であり、AIの安全性に関する意見を提供する機会を広げ、世界に情報を提供し、ラボを明確で独立して支持された安全性の主張に対して説明責任を負わせるものです。フロンティアのペースを維持する取り組みの一環として、OpenAIは、トレーニング、評価、展開にわたる深いレベルのアクセスを伴う独立した評価を支援することにコミットしています。そのアクセスにより、評価者は私たちの仮定に異議を唱え、私たちが見落とした可能性のあるリスクを特定し、私たちのセーフガードの有効性について独自の結論に達することができるはずです。

私たちは長い間、モデル開発と展開プロセスのさまざまな段階で第三者評価者と協力してきました。また、第三者評価を私たちの準備フレームワークの実践に組み込み、より厳格で説明責任のあるプロセスを提唱する組織や立法を支援してきました。これらの関与を通じて、私たちは技術的セーフガードに関する情報、可視的な思考連鎖へのアクセス、インシデント対応とモニターレッドチーミングのための前例のないレベルの機密データと内部展開アクセスなど、深い形のアクセスを提供してきました。ここで共有する優先事項と原則は、技術的安全評価に関する民間および非営利セクターの独立した評価組織との関与に焦点を当てています。これらは、テストと評価に関する政府との私たちの仕事を補完するものであり、そこでは異なる役割と責任が異なるアプローチを必要とする場合があります。

これらの評価を効果的にするには、強力な独立性メカニズム、科学的厳密性、堅牢なセキュリティ慣行、明確な責任が必要です。ラボには、機密情報を保護しながら意味のある精査を可能にする責任があります。ラボと独立した評価者はこれを正しく行う責任を共有し、安全性とセキュリティの慣行に関する共通の国際基準で運営されるべきです。以下では、より深い評価のための4つの優先領域と、厳格で安全かつ独立した作業のための原則を提案します。

評価の優先領域:第三者評価は、特定の重要な問題に対処するときに最も有用です。証拠はラボの安全性ケースと安全性の主張を支持していますか?評価は、測定することを意図したリスクを適切にテストしていますか?セーフガードは現実的な条件下で機能しますか?ここで説明する評価は、検討される安全問題に応じて異なる形を取ることを意図しています。私たちは、数週間続くものもあれば数ヶ月続くものもあり、異なる期間にわたって並行して複数の評価を支援することを期待しています。第三者評価は展開前の作業の一部となり、展開の決定に情報を提供することもありますが、ここで説明する作業は一般的に長期的でローンチに依存しないものであり、時間をかけて特定の安全性の主張を深く検討することに焦点を当てています。私たちの優先領域と原則では、安全性の主張と安全性ケースに言及しています。これらの用語で私たちが意味するのは以下のとおりです。私たちは、より深い評価のための4つの優先領域と、厳格で安全かつ独立した作業のための原則を提案します。トレーニング、評価、内部展開、外部展開にわたる安全性ケースの独立した評価。安全性ケースの評価には、アラインメント、モニタリングなどの制御方法、サイバーセキュリティ、生物学的および化学的悪用、レッドチーミングの専門知識が必要です。安全性ケースは、トレーニング、能力評価、セーフガードを含む主張で構成され、全体または部分で評価できます(以下の優先事項2と3を参照)。複数の評価者が、それぞれの専門知識を活かしてケースの異なる部分を検討する必要があるでしょう。彼らの評価は合わせて、次のような質問に答えるべきです。トレーニング、評価、展開の安全性ケースの証拠は実証されていますか?トレーニング、評価中に安全性ケースの条件は守られましたか...

FAQ Q:第三者評価に関するOpenAIの優先事項は何ですか?

FAQ A:OpenAIは、より深い評価のための4つの優先領域と、厳格で安全かつ独立した作業のための原則を提案しています。これらには、トレーニング、評価、内部展開、外部展開にわたる安全性ケースの独立した評価が含まれます。