HeadlinesBriefing favicon HeadlinesBriefing.com

フロンティアモデル物理ベンチマークの崩壊

Hacker News •
×

Artificial Analysis Intelligence Index(2026)を含む主要な物理ベンチマークで報告された低いスコアは、フロンティア言語モデルが依然として高度な物理学に苦戦していることを示唆している。しかし、これは必ずしもドメイン専門家の経験と一致しない。

我々は、広く使用されている6つの物理ベンチマークでフロンティアモデルを評価し、専門家とともに監査することで、これらの知見を再検討する。検証可能な最終回答を持つテキストのみの問題に焦点を当てる。教員と大学院研究者が問題文、参照解答、モデルの回答をレビューし、真のモデルエラーと採点エラー、誤った参照解答、曖昧な質問を区別する。

最初に不正解と評価された監査対象ケースのほとんどは、モデルの物理推論のエラーではなく、ベンチマークの問題を反映している。専門家はその後、誤った参照解答を修正し、欠陥のある質問を修復または除外する。GPT-5.6-Solの測定されたmean@4は、HLE-Physicsで47.3%から78.7%に、CMT-Benchmarkで61.0%から87.2%に上昇し、修正されたpass@4は保持された54のCrit Ptチャレンジで94.4%に達する。

修正されたスコアは、専門家レビュー後に保持された評価サブセットで計算される。UGPhysics、PRISM-Physics、PHYBenchの監査済みサブセットのスコアも大幅に上昇する。これらの知見は、現在のベンチマークが、適切に定式化された物理問題を解くフロンティアモデルの能力を大幅に過小評価していることを示唆している。これらの閉じたタスクでのほぼ飽和は、より厳格で専門家に検証された評価の必要性を浮き彫りにしている。

主要エンティティ:企業:arXiv、Artificial Analysis | 人物:Ali Ansari、Haoran Sun、Andy Zeyi Liu、Mark Jabbour、Yongshan Ding、Steven Girvin、Yu He、Sohrab Ismail-Beigi、Aleksander Kubica、Owen D. Miller、Corey O'Hern、Vidvuds Ozolins、David Poland、A. Douglas Stone、Frank C. van den Bosch、Logan Wright、Navid Akbari、Santanu Antu、Kangle Cai、Andrew Calabrese-Day、Mateo Cárdenes Wuttig、Meng Cheng、Barry T. Chiang、Ali Ghorashi、Shouzhen Gu、Haoyang Huang、Zhibo Kang、Lukas Kienesberger、Hantian Liu、Charles Lomba、Zhongling Lu、Wenchao Ma、Rohin E. Mc Intosh、Evan Mc Kinney、Ivan Rojkov、Xulei Sun、Yarone Meir Tokayer、Naveen Balaji Umasankar、Mira Varma、Leda Wang、Qimin Wang、Tyler Wang、Haoyu Wei、Jinming Yang、Jinchen Zhao、Sherlock Tingrui Zhao、Qinyuan Zheng、Jay S. Zou、Lucas Baker、Arman Cohan、John Sous

FAQ:修正された物理ベンチマークスコアはフロンティア言語モデルについて何を明らかにするか?

専門家による監査後、GPT-5.6-Solの修正スコアは大幅に上昇し、保持されたCrit Ptチャレンジで94.4%のpass@4に達し、現在のベンチマークがフロンティアモデルの物理推論能力を過小評価していることを示している。