HeadlinesBriefing favicon HeadlinesBriefing.com

Intelligence Index v4.2 リリース

Hacker News •
×

Artificial Analysis は Intelligence Index v4.2 をリリースしました。これは中間アップデートであり、急速な frontier モデルの進展についていくために、予定されている v5 リリースの一部要素を前倒ししています。このアップデートでは、より複雑で現実的なタスクを導入し、非公開の保持されたテストセットを Index の重みの 40% に増やしました — v4.1 の数値の 2 倍 — これにより評価のゲーミングを防ぐことができます。2 つの主要な評価が追加されました:AA-Briefcase、これは社内で開発されたエージェントベースの知識ワークベンチマークで、非公開テストセットを使用して数千のソースファイルにわたる数週間のプロジェクトをテストします。また、Surge AI の GDP.pdf は、4,592 ページの PDF にわたる長いコンテキストのドキュメント推論を評価し、1,275 個の専門家作成の原子的基準を含みます。グレーディングインフラのアップグレードには、AA-LCR v1.1 のスコアリング精度の向上、GDPval-AA v2 と AA-Briefcase の Elo レーティングの安定化、および Sci Code のより堅牢なグレーディングサンドボックスが含まれます。主要な結果によると、AnthropicClaude Fable 5.1 が Index をリードし、その後に Open AIGPT-6 Astra が続き、GPT-5.6 Sol に対して 4 ポイントの向上を遂げました。Meta は 3 位、その後に Space XAIMoonshot/Kimi、Z.AI、Google が続きます。Cost per Task パレートフロンティアは Anthropic、Open AI、Meta、Z.AI によって共有されており、GPT-6 Astra は知能フロンティアの近くで出力トークン効率のフロンティアを支配しています。