HeadlinesBriefing favicon HeadlinesBriefing.com

ByteDance Tsinghua lançam DAPO RL

Hacker News •
×

ByteDance Seed e Tsinghua AIR lançaram o DAPO, um sistema de aprendizado por reforço de código aberto para LLMs em grande escala. O sistema alcança mais de 50 pontos no AIME 2024 usando Qwen2.5-32B, superando métodos anteriores com menos etapas de treinamento. O DAPO introduz Decoupled Clip e Dynamic Sampling Policy Optimization.

Inclui algoritmo, código, conjunto de dados e pesos do modelo. Os registros de treinamento mostram maior estabilidade de comprimento, consistência na pontuação de recompensa e controle de entropia. A configuração do ambiente usa conda e pip.

Código de inferência e problemas de exemplo são fornecidos. O projeto é baseado no framework verl. Pesquisadores são convidados a discutir via issues do GitHub.