HeadlinesBriefing favicon HeadlinesBriefing.com

RL para LLMs: El Efecto Mateo y Nunca te Rindas

Hacker News •
×

Esta entrada de blog analiza un artículo sobre post-entrenamiento con RL de LLMs, presenta el Efecto Mateo y propone 'Nunca te Rindas' para resolverlo. El autor presenta de forma interactiva, con detalles técnicos más profundos en el artículo y el código.

Todo practicante de RL ha visto una curva de evaluación subir, como AIME 2025 durante el entrenamiento de Olmo 3.1 RL-Zero Math. Pero ¿qué significa? Al dividir 30 preguntas de AIME en niveles de dificultad según el pass@32 inicial, encontramos que los problemas fáciles mejoran drásticamente, mientras que los difíciles (pass@32 inicial=0) apenas mejoran. El promedio ocultó esto: las ganancias provienen de problemas más fáciles. Este es el Efecto Mateo.

Vemos algo similar en RL de código y RL agéntico usando Deepcoder y Deep SWE. Las ganancias son proporcionales a la competencia inicial. Conectamos esto con el Efecto Mateo en la ciencia de redes y la economía: 'los ricos se hacen más ricos'. El Efecto Mateo en RL para LLMs: RL mejora el rendimiento en proporción a la competencia inicial—las tareas fáciles se vuelven más fáciles, las difíciles siguen siendo difíciles.

¿Causas? No solo GRPO. Si no hay respuesta correcta en k muestras, no hay gradiente. Una solución: muestrear más completaciones (mayor k). Probamos con Qwen 2.5 0.5B Instruct en GSM8k platinum, variando k.