HeadlinesBriefing favicon HeadlinesBriefing.com

Физические бенчмарки фронтирных моделей сломаны

Hacker News •
×

Низкие reported оценки на ведущих физических бенчмарках, включая те, что в Artificial Analysis Intelligence Index (2026), указывают на то, что фронтирные языковые модели всё ещё испытывают трудности с продвинутой физикой. Однако это не всегда соответствует опыту экспертов в предметной области.

Мы пересматриваем эти выводы, оценивая фронтирные модели на шести широко используемых физических бенчмарках и проводя их аудит с экспертами, сосредоточившись на текстовых задачах с проверяемыми окончательными ответами. Преподаватели и исследователи-аспиранты проверяют условия задач, эталонные решения и ответы моделей, чтобы отличить подлинные ошибки моделей от ошибок оценщика, неверных эталонных решений и неоднозначных вопросов.

Большинство проверенных случаев, первоначально оценённых как неверные, отражают проблемы бенчмаркинга, а не ошибки в физическом рассуждении моделей. Затем эксперты исправляют ошибочные эталонные решения и исправляют или исключают дефектные вопросы. Измеренный mean@4 GPT-5.6-Sol возрастает с 47,3% до 78,7% на HLE-Physics и с 61,0% до 87,2% на CMT-Benchmark, а его исправленный pass@4 достигает 94,4% на 54 сохранённых задачах Crit Pt.

Исправленные оценки вычисляются на сохранённых подмножествах оценки после экспертной проверки. Оценки на проверенных подмножествах UGPhysics, PRISM-Physics и PHYBench также значительно возрастают. Эти выводы показывают, что текущие бенчмарки существенно занижают способность фронтирных моделей решать корректно поставленные физические задачи. Почти насыщение на этих закрытых задачах подчёркивает необходимость более требовательных, экспертно проверенных оценок.

Ключевые сущности: Компании: arXiv, Artificial Analysis | Люди: Ali Ansari, Haoran Sun, Andy Zeyi Liu, Mark Jabbour, Yongshan Ding, Steven Girvin, Yu He, Sohrab Ismail-Beigi, Aleksander Kubica, Owen D. Miller, Corey O'Hern, Vidvuds Ozolins, David Poland, A. Douglas Stone, Frank C. van den Bosch, Logan Wright, Navid Akbari, Santanu Antu, Kangle Cai, Andrew Calabrese-Day, Mateo Cárdenes Wuttig, Meng Cheng, Barry T. Chiang, Ali Ghorashi, Shouzhen Gu, Haoyang Huang, Zhibo Kang, Lukas Kienesberger, Hantian Liu, Charles Lomba, Zhongling Lu, Wenchao Ma, Rohin E. Mc Intosh, Evan Mc Kinney, Ivan Rojkov, Xulei Sun, Yarone Meir Tokayer, Naveen Balaji Umasankar, Mira Varma, Leda Wang, Qimin Wang, Tyler Wang, Haoyu Wei, Jinming Yang, Jinchen Zhao, Sherlock Tingrui Zhao, Qinyuan Zheng, Jay S. Zou, Lucas Baker, Arman Cohan, John Sous