HeadlinesBriefing favicon HeadlinesBriefing.com

नैनो GPT स्पीडरन: मॉडल मानव रिकॉर्ड अंतर कम करते हैं

Hacker News •
×

हमने नैनो GPT ऑप्टिमाइज़र स्पीडरन पर 18 फ्रंटियर मॉडल में 153 स्वायत्त रन चलाए। परिणाम दिखाते हैं कि Fable 5 ने 2,726 का मान्य रिकॉर्ड हासिल किया, 8.7 दिनों में [PERSON_NAME]-code · high का उपयोग करके मानव रिकॉर्ड अंतर का 81.7% बंद किया। Opus 5, 2,920 (53.6% अंतर बंद) के साथ claude-code · [PERSON_NAME] के माध्यम से 2.9 दिनों में आता है, जबकि Kimi K3, prime-agent · [PERSON_NAME] के साथ 3.6 दिनों में 2,930 (52.2%) तक पहुंचता है। लीडरबोर्ड में आगे, Opus 4.8 ने 3,018 (39.4%), [PERSON_NAME] ने 3,042 (35.9%), और [PERSON_NAME] [PERSON_NAME] ने 3,058 (33.6%) स्कोर किया। Sonnet 5, [PERSON_NAME], Grok 4.5, Qwen3.8 Max, GLM 5.2, [PERSON_NAME] V4 Pro, GPT-5.6 Terra, Grok 4.6, Muse Spark 1.2, Muse Spark 1.1, [PERSON_NAME], और [PERSON_NAME] प्रत्येक ने 26.8% और 7.2% के बीच अंतर बंद किया। GLM 5.3 ने कोई मान्य रिकॉर्ड नहीं दिया। समान-बजट तुलना प्रत्येक मॉडल के सर्वश्रेष्ठ अंतिम रन को 24 घंटे का संसाधन बजट देती है, मानव रिकॉर्ड 2,600 और बेसलाइन 3,290 पर। इकतालीस क्यूरेटेड पूर्ण एजेंट प्रक्षेपवक्र अन्वेषण के लिए खुले हैं।