HeadlinesBriefing favicon HeadlinesBriefing.com

ByteDance y Tsinghua lanzan DAPO RL

Hacker News •
×

ByteDance Seed y Tsinghua AIR han lanzado DAPO, un sistema de aprendizaje por refuerzo de código abierto para LLM a gran escala. El sistema alcanza más de 50 puntos en AIME 2024 usando Qwen2.5-32B, superando a métodos previos con menos pasos de entrenamiento. DAPO introduce Decoupled Clip y Dynamic Sampling Policy Optimization.

Incluye algoritmo, código, conjunto de datos y pesos del modelo. Los registros de entrenamiento muestran mayor estabilidad de longitud, consistencia en la puntuación de recompensa y control de entropía. La configuración del entorno usa conda y pip.

Se proporcionan código de inferencia y problemas de ejemplo. El proyecto se basa en el marco verl. Se invita a los investigadores a discutir a través de GitHub Issues.