HeadlinesBriefing favicon HeadlinesBriefing.com

二重盲検AI評価

Google DeepMind Blog •
×

AIベンチマークの結果は、モデルがテスト問題を事前に見た場合に歪む可能性があり、これはベンチマーク汚染として知られる問題です。これに対処するため、Google DeepMindは独自のフロンティアモデルに対する世界初の二重盲検評価をパイロット実施しています。このアプローチは、外部評価を暗号化された「ボックス」に保持し、テスト前にパフォーマンスを最適化するために使用できないようにします。

Googleは、シンガポールAI安全研究所、OpenMined、AVERI、MLCommonsと提携し、プライバシー保護環境で機密ベンチマークに対してGemini Flash Liteモデルをテストしています。これにより、モデルが質問を「覗き見る」ことを防ぎ、評価の完全性が向上します。

以前は、外部パートナーはテストプロンプトを機密に保つためにゼロログプロトコルと契約上の保護手段を使用していました。技術的および暗号化的な保護手段を追加することは大きな前進です。政策立案者、研究者、企業は、モデルの真の能力と安全性を正確に反映する信頼できるベンチマークを必要としています。

主要エンティティ:企業:Google DeepMind、OpenMined、MLCommons | 場所:シンガポール