HeadlinesBriefing favicon HeadlinesBriefing.com

Artificial Analysis Intelligence Index v4.2 发布

Hacker News •
×

Artificial Analysis 已发布 Intelligence Index v4.2,这是一项中期更新,旨在加速计划中的 v5 发布内容,以跟上快速发展的前沿模型进展。该更新引入了更复杂、更逼真的任务,并将私有、未公开的测试集比例提高至 Index 权重的 40% —— 翻倍于 v4.1 的数值 —— 以防止刷分作弊。新增了两项重要评估:AA-Briefcase,一项由 Artificial Analysis 自行开发的代理知识工作基准测试,采用私有测试集测试跨数千源文件的多周项目;以及 Surge AI 的 GDP.pdf,评估跨 4,592 页 PDF 的长上下文文档推理,包含 1,275 个专家撰写的原子评判标准。评分基础设施升级包括 AA-LCR v1.1 中改进的评分准确率、GDPval-AA v2 和 AA-Briefcase 的稳定 Elo 评分,以及 Sci Code 更强大的评分沙箱。关键结果显示 Anthropic 的 Claude Fable 5.1 领跑 Index,紧随其后的是 Open AIGPT-6 Astra,较 GPT-5.6 Sol 提升了 4 分。Meta 排名第三,之后依次为 Space XAIMoonshot/Kimi、Z.AI 和 Google。Cost per Task 帕累托前沿由 Anthropic、Open AI、Meta 和 Z.AI 共享,而 GPT-6 Astra 则主导着靠近智力前沿的输出标记效率前沿。