HeadlinesBriefing favicon HeadlinesBriefing.com

NanoGPT Speedrun : Modèles comblent écart record humain

Hacker News •
×

Nous avons effectué 153 exécutions autonomes sur 18 modèles de pointe dans le speedrun de l'optimiseur nano GPT. Les résultats montrent que Fable 5 atteint un record validé de 2,726, comblant 81.7% de l'écart du record humain en 8.7 jours en utilisant [PERSON_NAME]-code · high. Opus 5 suit avec 2,920 (53.6% de l'écart comblé) via claude-code · [PERSON_NAME] en 2.9 jours, tandis que Kimi K3 atteint 2,930 (52.2%) avec prime-agent · [PERSON_NAME] en 3.6 jours.

Plus bas dans le classement, Opus 4.8 obtient 3,018 (39.4%), [PERSON_NAME] atteint 3,042 (35.9%), et [PERSON_NAME] [PERSON_NAME] enregistre 3,058 (33.6%). Sonnet 5, [PERSON_NAME], Grok 4.5, Qwen3.8 Max, GLM 5.2, [PERSON_NAME] V4 Pro, GPT-5.6 Terra, Grok 4.6, Muse Spark 1.2, Muse Spark 1.1, [PERSON_NAME] et [PERSON_NAME] comblent chacun entre 26.8% et 7.2% de l'écart. GLM 5.3 n'a produit aucun record validé.

Une comparaison à budget égal donne à chaque modèle son meilleur run final avec un budget de ressources de 24 heures, le record humain étant à 2,600 et la baseline à 3,290. Quarante et une trajectoires d'agent complètes organisées - incluant les appels d'outils, sous-agents et brouillons - sont ouvertes à l'exploration.