HeadlinesBriefing favicon HeadlinesBriefing.com

Physik-Benchmarks für Frontier-Modelle fehlerhaft

Hacker News •
×

Die niedrigen berichteten Ergebnisse bei führenden Physik-Benchmarks, einschließlich derer im Artificial Analysis Intelligence Index (2026), deuten darauf hin, dass Frontier-Sprachmodelle noch immer mit fortgeschrittener Physik kämpfen. Dies stimmt jedoch nicht immer mit den Erfahrungen von Domänenexperten überein.

Wir überprüfen diese Ergebnisse, indem wir Frontier-Modelle an sechs weit verbreiteten Physik-Benchmarks bewerten und sie mit Experten auditieren, wobei wir uns auf reine Textprobleme mit überprüfbaren Endergebnissen konzentrieren. Fakultätsmitglieder und Doktoranden überprüfen Problemstellungen, Referenzlösungen und Modellantworten, um echte Modellfehler von Bewertungsfehlern, falschen Referenzlösungen und mehrdeutigen Fragen zu unterscheiden.

Die meisten auditierten Fälle, die zunächst als falsch bewertet wurden, spiegeln Benchmarking-Probleme wider und nicht Fehler im physikalischen Denken der Modelle. Experten korrigieren dann fehlerhafte Referenzlösungen und reparieren oder schließen fehlerhafte Fragen aus. Der gemessene mean@4 von GPT-5.6-Sol steigt von 47,3% auf 78,7% bei HLE-Physics und von 61,0% auf 87,2% bei CMT-Benchmark, während sein korrigierter pass@4 94,4% bei den 54 beibehaltenen Crit Pt-Herausforderungen erreicht.

Korrigierte Ergebnisse werden auf beibehaltenen Bewertungsteilmengen nach Expertenprüfung berechnet. Die Ergebnisse bei auditierten Teilmengen von UGPhysics, PRISM-Physics und PHYBench steigen ebenfalls erheblich. Diese Ergebnisse deuten darauf hin, dass aktuelle Benchmarks die Fähigkeit von Frontier-Modellen, gut gestellte Physikprobleme zu lösen, erheblich unterschätzen. Die nahezu Sättigung bei diesen geschlossenen Aufgaben unterstreicht die Notwendigkeit anspruchsvollerer, von Experten validierter Bewertungen.

Wichtige Entitäten: Unternehmen: arXiv, Artificial Analysis | Personen: Ali Ansari, Haoran Sun, Andy Zeyi Liu, Mark Jabbour, Yongshan Ding, Steven Girvin, Yu He, Sohrab Ismail-Beigi, Aleksander Kubica, Owen D. Miller, Corey O'Hern, Vidvuds Ozolins, David Poland, A. Douglas Stone, Frank C. van den Bosch, Logan Wright, Navid Akbari, Santanu Antu, Kangle Cai, Andrew Calabrese-Day, Mateo Cárdenes Wuttig, Meng Cheng, Barry T. Chiang, Ali Ghorashi, Shouzhen Gu, Haoyang Huang, Zhibo Kang, Lukas Kienesberger, Hantian Liu, Charles Lomba, Zhongling Lu, Wenchao Ma, Rohin E. Mc Intosh, Evan Mc Kinney, Ivan Rojkov, Xulei Sun, Yarone Meir Tokayer, Naveen Balaji Umasankar, Mira Varma, Leda Wang, Qimin Wang, Tyler Wang, Haoyu Wei, Jinming Yang, Jinchen Zhao, Sherlock Tingrui Zhao, Qinyuan Zheng, Jay S. Zou, Lucas Baker, Arman Cohan, John Sous