HeadlinesBriefing favicon HeadlinesBriefing.com

NanoGPT Speedrun: Modelos Fecham Lacuna Recorde Humano

Hacker News •
×

Executamos 153 execuções autônomas em 18 modelos de fronteira no speedrun do otimizador nano GPT. Os resultados mostram o Fable 5 alcançando um recorde validado de 2.726, fechando 81,7% da lacuna do recorde humano em 8,7 dias usando [PERSON_NAME]-code · high. O Opus 5 segue com 2.920 (53,6% da lacuna fechada) via claude-code · [PERSON_NAME] em 2,9 dias, enquanto o Kimi K3 atinge 2.930 (52,2%) com prime-agent · [PERSON_NAME] em 3,6 dias.

Mais abaixo na classificação, o Opus 4.8 marca 3.018 (39,4%), [PERSON_NAME] atinge 3.042 (35,9%), e [PERSON_NAME] [PERSON_NAME] registra 3.058 (33,6%). Sonnet 5, [PERSON_NAME], Grok 4.5, Qwen3.8 Max, GLM 5.2, [PERSON_NAME] V4 Pro, GPT-5.6 Terra, Grok 4.6, Muse Spark 1.2, Muse Spark 1.1, [PERSON_NAME] e [PERSON_NAME] fecham cada um entre 26,8% e 7,2% da lacuna. O GLM 5.3 não produziu recorde validado.

Uma comparação de orçamento igual dá a cada modelo sua melhor execução final com um orçamento de recursos de 24 horas, com o recorde humano em 2.600 e a linha de base em 3.290. Quarenta e uma trajetórias completas de agentes curadas - incluindo chamadas de ferramentas, subagentes e rascunhos - estão abertas para exploração.