HeadlinesBriefing favicon HeadlinesBriefing.com

ByteDance Tsinghua lancent DAPO RL

Hacker News •
×

ByteDance Seed et Tsinghua AIR ont publié DAPO, un système d'apprentissage par renforcement open-source pour les LLM à grande échelle. Le système atteint plus de 50 points sur AIME 2024 en utilisant Qwen2.5-32B, surpassant les méthodes antérieures avec moins d'étapes d'entraînement. DAPO introduit Decoupled Clip et Dynamic Sampling Policy Optimization.

Il inclut l'algorithme, le code, le jeu de données et les poids du modèle. Les enregistrements d'entraînement montrent une stabilité de longueur améliorée, une cohérence du score de récompense et un contrôle de l'entropie. La configuration de l'environnement utilise conda et pip.

Le code d'inférence et des problèmes d'exemple sont fournis. Le projet s'appuie sur le framework verl. Les chercheurs sont invités à discuter via les issues GitHub.