HeadlinesBriefing favicon HeadlinesBriefing.com

AIインテリジェンス指数 v4.3 分析

Hacker News •
×

Artificial AnalysisのAIインテリジェンス指数v4.3は、AA-Briefcase、GDPval-AA v2、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1の10項目の評価を組み込んでいます。各評価の詳細と実行方法については、Intelligence Indexの方法論を参照してください。

モデルの重みが利用可能かどうかを示します。モデルは、商用利用が条件によって制限されている場合は「Commercial Use Restricted」、ライセンスが商用利用を禁止している場合は「Non-commercial」とラベルが付けられます。

能力指数は、特定の能力と業界におけるモデルのパフォーマンスを測ります。

Intelligence評価は、Artificial Analysisによって独立して測定されます。数値が高いほど良いです。

エージェント型コーディングとターミナル使用 専門文書推論 すべての通過 医療 長文脈推論 医療 分野でモデルの知能が一般的にユースケース間で翻訳される場合でも、特定の評価は一部のユースケースに関連している可能性があります。

AA-Briefcase Eloは、ルービック合格率、分析品質Elo、プレゼンテーションEloを集約するcombined metricです。Eloと95%信頼区間の境界は0でクランプされています。

AA-Omniscience指数(数値が高いほど良い)は、知識の信頼性と幻覚を測ります。正しい答えを報酬し、幻覚を罰金し、答えることを拒否しても罰金はありません。スコアは-100から100の範囲です。

主要エンティティ:企業:Artificial Analysis