HeadlinesBriefing favicon HeadlinesBriefing.com

Benchmarks de física de modelos de fronteira quebrados

Hacker News •
×

As baixas pontuações relatadas nos principais benchmarks de física, incluindo as do Artificial Analysis Intelligence Index (2026), sugerem que os modelos de linguagem de fronteira ainda têm dificuldades com física avançada. No entanto, isso nem sempre se alinha com as experiências dos especialistas do domínio.

Revisitamos esses achados avaliando modelos de fronteira em seis benchmarks de física amplamente utilizados e auditando-os com especialistas, com foco em problemas apenas de texto com respostas finais verificáveis. Professores e pesquisadores de pós-graduação revisam enunciados de problemas, soluções de referência e respostas dos modelos para distinguir erros genuínos do modelo de erros do avaliador, soluções de referência incorretas e perguntas ambíguas.

A maioria dos casos auditados inicialmente avaliados como incorretos reflete problemas de benchmarking em vez de erros no raciocínio físico dos modelos. Os especialistas então corrigem soluções de referência errôneas e reparam ou excluem perguntas defeituosas. O mean@4 medido do GPT-5.6-Sol sobe de 47,3% para 78,7% no HLE-Physics e de 61,0% para 87,2% no CMT-Benchmark, enquanto seu pass@4 corrigido atinge 94,4% nos 54 desafios Crit Pt retidos.

As pontuações corrigidas são calculadas em subconjuntos de avaliação retidos após revisão especializada. As pontuações em subconjuntos auditados do UGPhysics, PRISM-Physics e PHYBench também sobem substancialmente. Esses achados sugerem que os benchmarks atuais subestimam substancialmente a capacidade dos modelos de fronteira de resolver problemas de física bem formulados. A quase saturação nessas tarefas fechadas destaca a necessidade de avaliações mais exigentes e validadas por especialistas.

Entidades-chave: Empresas: arXiv, Artificial Analysis | Pessoas: Ali Ansari, Haoran Sun, Andy Zeyi Liu, Mark Jabbour, Yongshan Ding, Steven Girvin, Yu He, Sohrab Ismail-Beigi, Aleksander Kubica, Owen D. Miller, Corey O'Hern, Vidvuds Ozolins, David Poland, A. Douglas Stone, Frank C. van den Bosch, Logan Wright, Navid Akbari, Santanu Antu, Kangle Cai, Andrew Calabrese-Day, Mateo Cárdenes Wuttig, Meng Cheng, Barry T. Chiang, Ali Ghorashi, Shouzhen Gu, Haoyang Huang, Zhibo Kang, Lukas Kienesberger, Hantian Liu, Charles Lomba, Zhongling Lu, Wenchao Ma, Rohin E. Mc Intosh, Evan Mc Kinney, Ivan Rojkov, Xulei Sun, Yarone Meir Tokayer, Naveen Balaji Umasankar, Mira Varma, Leda Wang, Qimin Wang, Tyler Wang, Haoyu Wei, Jinming Yang, Jinchen Zhao, Sherlock Tingrui Zhao, Qinyuan Zheng, Jay S. Zou, Lucas Baker, Arman Cohan, John Sous