HeadlinesBriefing favicon HeadlinesBriefing.com

ByteDance Tsinghua Rilis DAPO RL

Hacker News •
×

ByteDance Seed dan Tsinghua AIR telah merilis DAPO, sistem reinforcement learning open-source untuk LLM skala besar. Sistem ini mencapai 50+ poin di AIME 2024 menggunakan Qwen2.5-32B, mengungguli metode sebelumnya dengan langkah pelatihan lebih sedikit. DAPO memperkenalkan Decoupled Clip dan Dynamic Sampling Policy Optimization.

Termasuk algoritma, kode, dataset, dan bobot model. Catatan pelatihan menunjukkan peningkatan stabilitas panjang, konsistensi skor reward, dan kontrol entropi. Pengaturan lingkungan menggunakan conda dan pip.

Kode inferensi dan contoh soal disediakan. Proyek dibangun pada framework verl. Peneliti diundang untuk berdiskusi melalui GitHub Issues.