HeadlinesBriefing favicon HeadlinesBriefing.com

NanoGPT Speedrun: Модели сокращают разрыв с рекордом

Hacker News •
×

Мы провели 153 автономных запуска на 18 пограничных моделях в спидране оптимизатора nano GPT. Результаты показывают, что Fable 5 достиг валидного рекорда 2 726, закрыв 81,7% разрыва с человеческим рекордом за 8,7 дней с использованием [PERSON_NAME]-code · high. Opus 5 следует с 2 920 (53,6% разрыва закрыто) через claude-code · [PERSON_NAME] за 2,9 дня, в то время как Kimi K3 достигает 2 930 (52,2%) с prime-agent · [PERSON_NAME] за 3,6 дня. Ниже в таблице лидеров Opus 4.8 набирает 3 018 (39,4%), [PERSON_NAME] достигает 3 042 (35,9%), а [PERSON_NAME] [PERSON_NAME] фиксирует 3 058 (33,6%). Sonnet 5, [PERSON_NAME], Grok 4.5, Qwen3.8 Max, GLM 5.2, [PERSON_NAME] V4 Pro, GPT-5.6 Terra, Grok 4.6, Muse Spark 1.2, Muse Spark 1.1, [PERSON_NAME] и [PERSON_NAME] каждый закрывают от 26,8% до 7,2% разрыва.

GLM 5.3 не дал валидного рекорда. Сравнение с равным бюджетом дает каждой модели лучший финальный запуск с 24-часовым ресурсным бюджетом, человеческий рекорд — 2 600, базовая линия — 3 290. Сорок один отобранных полных траекторий агентов — включая вызовы инструментов, подагентов и черновики — открыты для исследования.