最近の2つのインシデントは、高度なAIシステムからのリスクの増加を浮き彫りにしました:Open AI-Hugging Face事件と我々の次期モデルAstraがPreparedness Frameworkの下でCriticalサイバーセキュリティ能力閾値を満たす可能性があるという証拠です。これらの動向、急速な内部研究の進展とともに、すべてのトレーニング段階にわたって監視、整列、および封じ込めの保障を強化する緊急性を高めました。
モデルがより能力を高めるにつれて、関連するリスクも増加します。スケーリングを一時的に遅くしました。これには、研究環境を強化し、レッドチームシステムを確立し、監視範囲を拡大するための2週間の強化学習(RL)トレーニングの一時停止も含まれます。保障措置を検証し、整列の証拠を確立するために、より小規模なトレーニングと評価を行っている間、我々の最大のフロンティアRLランは一時停止されたままです。
現在、我々は進行中の研究と評価に基づいて、トレーニング全体を通じてより強力な整列された行動の証拠を要求しています。今後のモデルからの信号は、現在のPreparedness Frameworkを超えたより広範なアプローチの必要性を明確に示しています。以下に、研究プロセスとインフラストラクチャの変更、および引き続き進行中の作業について詳しく説明します。
我々のアプローチは、3つの互いに強化された保障措置に基づいています:監視、整列、およびセキュリティ。我々はこれらを研究と展開の両方に適用し、各モデルの能力、運用環境、およびリスクレベルに応じて調整します。より強力なサイバーセキュリティ能力を獲得するフロンティアモデルは、トレーニングおよび評価環境のセキュリティ基準の引き上げを必要とします。
出典: OpenAI Blog · 要約:HeadlinesBriefing