HeadlinesBriefing favicon HeadlinesBriefing.com

NanoGPT Speedrun: Modelos cierran brecha récord humano

Hacker News •
×

Realizamos 153 ejecuciones autónomas en 18 modelos frontera en el speedrun del optimizador nano GPT. Los resultados muestran que Fable 5 alcanza un récord validado de 2,726, cerrando el 81.7% de la brecha del récord humano en 8.7 días usando [PERSON_NAME]-code · high. Opus 5 le sigue con 2,920 (53.6% de brecha cerrada) vía claude-code · [PERSON_NAME] en 2.9 días, mientras que Kimi K3 llega a 2,930 (52.2%) con prime-agent · [PERSON_NAME] en 3.6 días.

Más abajo, Opus 4.8 marca 3,018 (39.4%), [PERSON_NAME] alcanza 3,042 (35.9%), y [PERSON_NAME] [PERSON_NAME] registra 3,058 (33.6%). Sonnet 5, [PERSON_NAME], Grok 4.5, Qwen3.8 Max, GLM 5.2, [PERSON_NAME] V4 Pro, GPT-5.6 Terra, Grok 4.6, Muse Spark 1.2, Muse Spark 1.1, [PERSON_NAME] y [PERSON_NAME] cierran entre 26.8% y 7.2% de la brecha. GLM 5.3 no produjo récord validado.

Una comparación de presupuesto igual da a cada modelo 24 horas, con récord humano en 2,600 y base en 3,290. Cuarenta y una trayectorias completas de agentes están abiertas para exploración.