HeadlinesBriefing favicon HeadlinesBriefing.com

字节跳动清华发布 DAPO RL 系统

Hacker News •
×

字节跳动 Seed 和清华 AIR 发布了 DAPO,这是一个面向大规模 LLM 的开源强化学习系统。该系统使用 Qwen2.5-32B 在 AIME 2024 上达到 50+ 分,以更少的训练步数超越了先前方法。DAPO 引入了解耦裁剪和动态采样策略优化。它包含算法、代码、数据集和模型权重。训练记录显示长度稳定性、奖励分数一致性和熵控制均有改进。环境搭建使用 conda 和 pip。提供了推理代码和示例问题。该项目基于 verl 框架构建。研究人员可通过 GitHub Issues 参与讨论。