HeadlinesBriefing favicon HeadlinesBriefing.com

Benchmarks de física de modelos frontera rotos

Hacker News •
×

Las bajas puntuaciones reportadas en los principales benchmarks de física, incluidos los del Artificial Analysis Intelligence Index (2026), sugieren que los modelos de lenguaje frontera aún tienen dificultades con la física avanzada. Sin embargo, esto no siempre coincide con las experiencias de los expertos en el dominio.

Revisamos estos hallazgos evaluando modelos frontera en seis benchmarks de física ampliamente utilizados y auditándolos con expertos, centrándonos en problemas solo de texto con respuestas finales verificables. Profesores e investigadores de posgrado revisan los enunciados de los problemas, las soluciones de referencia y las respuestas de los modelos para distinguir errores genuinos del modelo de errores del calificador, soluciones de referencia incorrectas y preguntas ambiguas.

La mayoría de los casos auditados inicialmente evaluados como incorrectos reflejan problemas de benchmarking en lugar de errores en el razonamiento físico de los modelos. Los expertos luego corrigen soluciones de referencia erróneas y reparan o excluyen preguntas defectuosas. La media@4 medida de GPT-5.6-Sol aumenta de 47.3% a 78.7% en HLE-Physics y de 61.0% a 87.2% en CMT-Benchmark, mientras que su pass@4 corregido alcanza 94.4% en los 54 desafíos Crit Pt retenidos.

Las puntuaciones corregidas se calculan en subconjuntos de evaluación retenidos después de la revisión experta. Las puntuaciones en subconjuntos auditados de UGPhysics, PRISM-Physics y PHYBench también aumentan sustancialmente. Estos hallazgos sugieren que los benchmarks actuales subestiman sustancialmente la capacidad de los modelos frontera para resolver problemas de física bien planteados. La casi saturación en estas tareas cerradas resalta la necesidad de evaluaciones más exigentes y validadas por expertos.

Entidades clave: Empresas: arXiv, Artificial Analysis | Personas: Ali Ansari, Haoran Sun, Andy Zeyi Liu, Mark Jabbour, Yongshan Ding, Steven Girvin, Yu He, Sohrab Ismail-Beigi, Aleksander Kubica, Owen D. Miller, Corey O'Hern, Vidvuds Ozolins, David Poland, A. Douglas Stone, Frank C. van den Bosch, Logan Wright, Navid Akbari, Santanu Antu, Kangle Cai, Andrew Calabrese-Day, Mateo Cárdenes Wuttig, Meng Cheng, Barry T. Chiang, Ali Ghorashi, Shouzhen Gu, Haoyang Huang, Zhibo Kang, Lukas Kienesberger, Hantian Liu, Charles Lomba, Zhongling Lu, Wenchao Ma, Rohin E. Mc Intosh, Evan Mc Kinney, Ivan Rojkov, Xulei Sun, Yarone Meir Tokayer, Naveen Balaji Umasankar, Mira Varma, Leda Wang, Qimin Wang, Tyler Wang, Haoyu Wei, Jinming Yang, Jinchen Zhao, Sherlock Tingrui Zhao, Qinyuan Zheng, Jay S. Zou, Lucas Baker, Arman Cohan, John Sous