HeadlinesBriefing favicon HeadlinesBriefing.com

训练一个3.8B参数LLM仅花费998美元:Hugo Vergnes的成果

Hacker News •
×

Hugo Vergnes用租用的B200 GPU训练3.8B参数LLM,仅花费998美元,43小时达0.384 CORE分数。该项目作为一个名为little-lm的配置驱动框架,强调干净的基础设施和软件工程实践。模型细节包括Llama式架构,RMSNorm,RoPE,GQA(24查询,8 KV heads),relu² MLPs,QK-norm,logit softcap,以及总计3.848B参数的ResFormer-style value embeddings,其中value embeddings占19%。与nanochat d32(~1B参数,~1000美元,0.310 CORE)相比,该模型在相似成本和时间下取得了显著更好的性能。Vergnes强调,良好的基础设施能减少手动代码更改,通过YAML diffs启用实验。在Fine Web-Edu上的早期失败,使用858M模型展示了学习率调度和优化器选择的重要性,Muon相对于AdamW在矩阵参数上显示出前景。该工程展示了在不依赖超级企业的情况下,用适度预算进行有意义的LLM训练是可行的。