HeadlinesBriefing favicon HeadlinesBriefing.com

Claude Opus 5.5 分析:知能、パフォーマンス、価格

Hacker News •
×

Artificial Analysis Intelligence Index v4.3.2 は、10 の評価を組み込んでいます:AA-Briefcase v1.1、GDPval-AA v2.1、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1。各評価の内訳や実施方法など、詳細については Intelligence Index の方法論をご覧ください。

AA-Briefcase v1.1 は、Artificial Analysis が開発したエージェント型ナレッジワークベンチマークです。AA-Briefcase Elo は、ルーブリック合格率、分析品質 Elo、プレゼンテーション Elo を集約した複合指標です · 高いほど良い。AA-Omniscience Index は、知識の信頼性とハルシネーションを測定します。正解には報酬を与え、ハルシネーションにはペナルティを課し、回答を拒否することにはペナルティがありません。スコアは -100 から 100 の範囲で、0 は正解と不正解が同数であることを意味します。

Intelligence Index の比較:Intelligence Index 対 Intelligence Index タスクあたりのコスト。Intelligence Index タスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答のトークン価格から計算され、タスク数で割られ、Intelligence Index の重みで加重されます。

主要エンティティ:企業:Artificial Analysis

FAQ:Artificial Analysis Intelligence Index とは何ですか?

Artificial Analysis Intelligence Index v4.3.2 は、10 の評価を組み込んでいます:AA-Briefcase v1.1、GDPval-AA v2.1、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1。

FAQ 質問:Artificial Analysis Intelligence Index とは何ですか?

FAQ 回答:Artificial Analysis Intelligence Index v4.3.2 は、10 の評価を組み込んでいます:AA-Briefcase v1.1、GDPval-AA v2.1、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1。