HeadlinesBriefing favicon HeadlinesBriefing.com

Benchmark Fisika Model Frontier Rusak

Hacker News •
×

Skor rendah yang dilaporkan pada benchmark fisika terkemuka, termasuk yang ada di Artificial Analysis Intelligence Index (2026), menunjukkan bahwa model bahasa frontier masih kesulitan dengan fisika tingkat lanjut. Namun, hal ini tidak selalu selaras dengan pengalaman para ahli domain.

Kami meninjau kembali temuan ini dengan mengevaluasi model frontier pada enam benchmark fisika yang banyak digunakan dan mengauditnya bersama para ahli, dengan fokus pada masalah teks saja dengan jawaban akhir yang dapat diverifikasi. Fakultas dan peneliti pascasarjana meninjau pernyataan masalah, solusi referensi, dan respons model untuk membedakan kesalahan model yang sebenarnya dari kesalahan penilai, solusi referensi yang salah, dan pertanyaan yang ambigu.

Sebagian besar kasus yang diaudit yang awalnya dinilai salah mencerminkan masalah benchmarking daripada kesalahan dalam penalaran fisika model. Para ahli kemudian mengoreksi solusi referensi yang salah dan memperbaiki atau mengecualikan pertanyaan yang cacat. mean@4 terukur GPT-5.6-Sol naik dari 47,3% menjadi 78,7% pada HLE-Physics dan dari 61,0% menjadi 87,2% pada CMT-Benchmark, sementara pass@4 yang dikoreksi mencapai 94,4% pada 54 tantangan Crit Pt yang dipertahankan.

Skor yang dikoreksi dihitung pada subset evaluasi yang dipertahankan setelah tinjauan ahli. Skor pada subset yang diaudit dari UGPhysics, PRISM-Physics, dan PHYBench juga naik secara substansial. Temuan ini menunjukkan bahwa benchmark saat ini secara substansial meremehkan kemampuan model frontier untuk menyelesaikan masalah fisika yang terdefinisi dengan baik. Hampir jenuh pada tugas-tugas tertutup ini menyoroti kebutuhan akan evaluasi yang lebih menuntut dan divalidasi oleh ahli.

Entitas Kunci: Perusahaan: arXiv, Artificial Analysis | Orang: Ali Ansari, Haoran Sun, Andy Zeyi Liu, Mark Jabbour, Yongshan Ding, Steven Girvin, Yu He, Sohrab Ismail-Beigi, Aleksander Kubica, Owen D. Miller, Corey O'Hern, Vidvuds Ozolins, David Poland, A. Douglas Stone, Frank C. van den Bosch, Logan Wright, Navid Akbari, Santanu Antu, Kangle Cai, Andrew Calabrese-Day, Mateo Cárdenes Wuttig, Meng Cheng, Barry T. Chiang, Ali Ghorashi, Shouzhen Gu, Haoyang Huang, Zhibo Kang, Lukas Kienesberger, Hantian Liu, Charles Lomba, Zhongling Lu, Wenchao Ma, Rohin E. Mc Intosh, Evan Mc Kinney, Ivan Rojkov, Xulei Sun, Yarone Meir Tokayer, Naveen Balaji Umasankar, Mira Varma, Leda Wang, Qimin Wang, Tyler Wang, Haoyu Wei, Jinming Yang, Jinchen Zhao, Sherlock Tingrui Zhao, Qinyuan Zheng, Jay S. Zou, Lucas Baker, Arman Cohan, John Sous