HeadlinesBriefing favicon HeadlinesBriefing.com

水星 2.5 知能、パフォーマンスおよび価格分析

Hacker News •
×

人工分析知能指数 v4.3.2 は以下の 10 の評価を含みます:AA-Briefcase v1.1、GDPval-AA v2.1、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1。この指数はオープンウェイト モデルとプロプライエタリ モデルを測定し、商用利用制限のラベルを含みます。AA-Briefcase v1.1 は、ルーブリック合格率、分析品質 Elo、プレゼンテーション品質 Elo を組み合わせたエージェント型知識作業ベンチマークです。AA-Omniscience 指数のスコアは -100 から 100 の範囲で、知識の信頼性と幻覚を測定し、拒否に対するペナルティはありません。知能あたりのタスクコスト指数は、入力、キャッシュヒット、キャッシュライト、推論、および回答トークン価格の重み付き平均米ドルコストをタスク数で割って計算されます。モデルの知能は一般的にユースケース間で転移しますが、特定の評価が特定のアプリケーションに対してより関連している場合があります。方法論には、各評価の内訳とその実行方法が含まれます。