HeadlinesBriefing favicon HeadlinesBriefing.com

AI 智能指数 v4.3 分析

Hacker News •
×

人工分析智能指数 v4.3 包含 10 项评估:AA-Briefcase、GDPval-AA v2、Automation Bench-AA、Terminal-Bench 4.0、Sci Code、Humanity's Last Exam、GDP.pdf、Crit Pt、AA-Omniscience、AA-LCR v1.1。详见智能指数方法论,包括每项评估的详细解释及运行方式。

指示模型权重是否可用。模型标记为“商业用受限”是因为商业用途受条件限制,标记为“非商业用”是因为许可证禁止商业用途。

能力指数衡量模型在特定能力和行业上的表现。

智能评估由 Artificial Analysis 独立测量。数值越高越好。

代理编码与终端使用 专业文档推理 所有通过的医疗 长上下文推理 虽然模型智能通常跨越用例,但特定评估可能针对某些用例更为相关。

AA-Briefcase Elo 是一个综合指标,聚合了评分通过率、分析质量 Elo 和呈现 Elo。Elo 及 95% 置信区间边界限制在 0 以下。

AA-Omniscience 指数(数值越高越好)衡量知识可靠性和幻觉情况。它奖励正确答案,惩罚幻觉,拒绝作答不加惩罚。分数范围从 -100 到 100。

关键实体:公司:Artificial Analysis