HeadlinesBriefing favicon HeadlinesBriefing.com

Entrenando un LLM de 3.8B por 998 dólares: Hugo Vergnes

Hacker News •
×

Hugo Vergnes entrenó un LLM de 3.8B parámetros usando GPUs B200 alquiladas durante 43 horas y 65B tokens por 998 dólares, logrando una puntuación de 0.384 CORE. El proyecto, construido como un framework configurativo llamado little-lm, enfatiza una infraestructura limpia y prácticas de ingeniería de software. Los detalles del modelo incluyen una arquitectura estilo Llama con RMSNorm, RoPE, GQA (24 query, 8 KV heads), MLPs de relu², QK-norm, softcap de logits y embeddings de valor estilo ResFormer que suman 3.848B parámetros, donde los embeddings de valor constituyen el 19%.

Comparado con nanochat d32 (~1B parámetros, ~1000 dólares, 0.310 CORE), este modelo logra un rendimiento significativamente mejor en costo y tiempo similares. Vergnes destaca que una buena infraestructura reduce los cambios de código manual, permitiendo experimentos mediante diffs de YAML. Los primeros fracasos con un modelo de 858M en Fine Web-Edu demostraron la importancia de la programación de tasas de aprendizaje y la elección del optimizador, mostrando que Muon promete más que AdamW para parámetros de matriz.

El trabajo demuestra que el entrenamiento significativo de LLM es accesible fuera de las mega-corporaciones con presupuestos modestos.