HeadlinesBriefing favicon HeadlinesBriefing.com

前沿模型物理基准测试存在缺陷

Hacker News •
×

在领先物理基准测试中报告的低分,包括Artificial Analysis Intelligence Index(2026)中的那些,表明前沿语言模型在高级物理方面仍然存在困难。然而,这并不总是与领域专家的经验相符。

我们通过在六个广泛使用的物理基准测试上评估前沿模型,并与专家一起审计这些结果,重新审视这些发现,重点关注具有可验证最终答案的纯文本问题。教职人员和研究生研究人员审查问题陈述、参考解决方案和模型响应,以区分真正的模型错误与评分器错误、不正确的参考解决方案和模糊问题。

大多数最初被评估为不正确的审计案例反映的是基准测试问题,而非模型物理推理中的错误。专家随后纠正错误的参考解决方案,并修复或排除有缺陷的问题。GPT-5.6-Sol在HLE-Physics上的测量mean@4从47.3%上升到78.7%,在CMT-Benchmark上从61.0%上升到87.2%,而其修正后的pass@4在54个保留的Crit Pt挑战上达到94.4%

修正后的分数是在专家审查后保留的评估子集上计算的。在UGPhysics、PRISM-Physics和PHYBench的审计子集上的分数也大幅上升。这些发现表明,当前的基准测试大幅低估了前沿模型解决定义明确的物理问题的能力。这些封闭式任务接近饱和,凸显了需要更严格、经专家验证的评估。

关键实体:公司:arXiv、Artificial Analysis | 人物:Ali Ansari、Haoran Sun、Andy Zeyi Liu、Mark Jabbour、Yongshan Ding、Steven Girvin、Yu He、Sohrab Ismail-Beigi、Aleksander Kubica、Owen D. Miller、Corey O'Hern、Vidvuds Ozolins、David Poland、A. Douglas Stone、Frank C. van den Bosch、Logan Wright、Navid Akbari、Santanu Antu、Kangle Cai、Andrew Calabrese-Day、Mateo Cárdenes Wuttig、Meng Cheng、Barry T. Chiang、Ali Ghorashi、Shouzhen Gu、Haoyang Huang、Zhibo Kang、Lukas Kienesberger、Hantian Liu、Charles Lomba、Zhongling Lu、Wenchao Ma、Rohin E. Mc Intosh、Evan Mc Kinney、Ivan Rojkov、Xulei Sun、Yarone Meir Tokayer、Naveen Balaji Umasankar、Mira Varma、Leda Wang、Qimin Wang、Tyler Wang、Haoyu Wei、Jinming Yang、Jinchen Zhao、Sherlock Tingrui Zhao、Qinyuan Zheng、Jay S. Zou、Lucas Baker、Arman Cohan、John Sous

FAQ:修正后的物理基准测试分数揭示了前沿语言模型的什么?

经过专家审计后,GPT-5.6-Sol的修正分数大幅上升,在保留的Crit Pt挑战上达到94.4%的pass@4,表明当前基准测试低估了前沿模型的物理推理能力。