HeadlinesBriefing favicon HeadlinesBriefing.com

سباق NanoGPT: نماذج تغلق فجوة الرقم القياسي البشري

Hacker News •
×

أجرينا 153 عملية مستقلة عبر 18 نموذجاً متطوراً في سباق محسن NanoGPT. تظهر النتائج تحقيق Fable 5 رقماً قياسياً موثقاً قدره 2,726، مما أغلق 81.7% من فجوة الرقم القياسي البشري في 8.7 أيام باستخدام [PERSON_NAME]-code · high. يليه Opus 5 بـ 2,920 (إغلاق 53.6% من الفجوة) عبر claude-code · [PERSON_NAME] في 2.9 يوم، بينما يصل Kimi K3 إلى 2,930 (52.2%) مع prime-agent · [PERSON_NAME] في 3.6 أيام. في أسفل لوحة المتصدرين، يسجل Opus 4.8 درجة 3,018 (39.4%)، ويحقق [PERSON_NAME] درجة 3,042 (35.9%)، ويسجل [PERSON_NAME] [PERSON_NAME] درجة 3,058 (33.6%). يغلق كل من Sonnet 5، [PERSON_NAME]، Grok 4.5، Qwen3.8 Max، GLM 5.2، [PERSON_NAME] V4 Pro، GPT-5.6 Terra، Grok 4.6، Muse Spark 1.2، Muse Spark 1.1، [PERSON_NAME]، و [PERSON_NAME] ما بين 26.8% و 7.2% من الفجوة. لم ينتج GLM 5.3 أي رقم قياسي موثق. تمنح المقارنة المتساوية الميزانية كل نموذج أفضل تشغيل نهائي له ميزانية موارد مدتها 24 ساعة، مع الرقم القياسي البشري عند 2,600 والأساس عند 3,290. أحد وأربعون مسار وكيل كاملاً منسقاً - بما في ذلك استدعاءات الأدوات والوكلاء الفرعيين ومسودات العمل - مفتوحة للاستكشاف.