HeadlinesBriefing favicon HeadlinesBriefing.com

ByteDance Tsinghua veröffentlichen DAPO RL

Hacker News •
×

ByteDance Seed und Tsinghua AIR haben DAPO veröffentlicht, ein Open-Source-Reinforcement-Learning-System für großskalige LLMs. Das System erreicht über 50 Punkte bei AIME 2024 mit Qwen2.5-32B und übertrifft frühere Methoden mit weniger Trainingsschritten. DAPO führt Decoupled Clip und Dynamic Sampling Policy Optimization ein. Es umfasst Algorithmus, Code, Datensatz und Modellgewichte.

Trainingsaufzeichnungen zeigen verbesserte Längenstabilität, Belohnungsscore-Konsistenz und Entropiekontrolle. Die Umgebungseinrichtung verwendet conda und pip. Inferenzcode und Beispielprobleme werden bereitgestellt.

Das Projekt basiert auf dem verl-Framework. Forscher sind eingeladen, über GitHub Issues zu diskutieren.