HeadlinesBriefing favicon HeadlinesBriefing.com

Benchmarks de physique des modèles frontières défaillants

Hacker News •
×

Les faibles scores rapportés sur les principaux benchmarks de physique, y compris ceux de l'Artificial Analysis Intelligence Index (2026), suggèrent que les modèles de langage frontières ont encore du mal avec la physique avancée. Pourtant, cela ne correspond pas toujours aux expériences des experts du domaine.

Nous réexaminons ces résultats en évaluant les modèles frontières sur six benchmarks de physique largement utilisés et en les auditant avec des experts, en nous concentrant sur des problèmes textuels avec des réponses finales vérifiables. Des enseignants et des chercheurs diplômés examinent les énoncés des problèmes, les solutions de référence et les réponses des modèles afin de distinguer les véritables erreurs des modèles des erreurs de notation, des solutions de référence incorrectes et des questions ambiguës.

La plupart des cas audités initialement évalués comme incorrects reflètent des problèmes de benchmarking plutôt que des erreurs dans le raisonnement physique des modèles. Les experts corrigent ensuite les solutions de référence erronées et réparent ou excluent les questions défectueuses. Le mean@4 mesuré de GPT-5.6-Sol passe de 47,3 % à 78,7 % sur HLE-Physics et de 61,0 % à 87,2 % sur CMT-Benchmark, tandis que son pass@4 corrigé atteint 94,4 % sur les 54 défis Crit Pt retenus.

Les scores corrigés sont calculés sur les sous-ensembles d'évaluation retenus après examen par les experts. Les scores sur les sous-ensembles audités d'UGPhysics, PRISM-Physics et PHYBench augmentent également considérablement. Ces résultats suggèrent que les benchmarks actuels sous-estiment considérablement la capacité des modèles frontières à résoudre des problèmes de physique bien posés. La quasi-saturation sur ces tâches fermées souligne la nécessité d'évaluations plus exigeantes et validées par des experts.

Entités clés : Entreprises : arXiv, Artificial Analysis | Personnes : Ali Ansari, Haoran Sun, Andy Zeyi Liu, Mark Jabbour, Yongshan Ding, Steven Girvin, Yu He, Sohrab Ismail-Beigi, Aleksander Kubica, Owen D. Miller, Corey O'Hern, Vidvuds Ozolins, David Poland, A. Douglas Stone, Frank C. van den Bosch, Logan Wright, Navid Akbari, Santanu Antu, Kangle Cai, Andrew Calabrese-Day, Mateo Cárdenes Wuttig, Meng Cheng, Barry T. Chiang, Ali Ghorashi, Shouzhen Gu, Haoyang Huang, Zhibo Kang, Lukas Kienesberger, Hantian Liu, Charles Lomba, Zhongling Lu, Wenchao Ma, Rohin E. Mc Intosh, Evan Mc Kinney, Ivan Rojkov, Xulei Sun, Yarone Meir Tokayer, Naveen Balaji Umasankar, Mira Varma, Leda Wang, Qimin Wang, Tyler Wang, Haoyu Wei, Jinming Yang, Jinchen Zhao, Sherlock Tingrui Zhao, Qinyuan Zheng, Jay S. Zou, Lucas Baker, Arman Cohan, John Sous

FAQ : Que révèlent les scores corrigés des benchmarks de physique sur les modèles de langage frontières ?

Après l'audit expert, les scores corrigés de GPT-5.6-Sol augmentent considérablement, atteignant 94,4 % de pass@4 sur les défis Crit Pt retenus, ce qui indique que les benchmarks actuels sous-estiment la capacité de raisonnement physique des modèles frontières.