HeadlinesBriefing favicon HeadlinesBriefing.com

RL para LLMs: O Efeito Mateus e Nunca Desista

Hacker News •
×

Este post de blog discute um artigo sobre pós-treinamento com RL de LLMs, apresenta o Efeito Mateus e propõe 'Nunca Desista' para resolvê-lo. O autor apresenta de forma interativa, com detalhes técnicos mais profundos no artigo e no código.

Todo praticante de RL já viu uma curva de avaliação subir, como AIME 2025 durante o treinamento do Olmo 3.1 RL-Zero Math. Mas o que isso significa? Dividindo 30 questões do AIME em níveis de dificuldade com base no pass@32 inicial, descobrimos que problemas fáceis melhoram drasticamente, enquanto problemas difíceis (pass@32 inicial=0) quase não melhoram. A média escondeu isso: os ganhos vêm de problemas mais fáceis. Este é o Efeito Mateus.

Vemos algo semelhante em RL de código e RL agêntico usando Deepcoder e Deep SWE. Os ganhos são proporcionais à competência inicial. Conectamos isso ao Efeito Mateus na ciência de redes e na economia: 'os ricos ficam mais ricos'. O Efeito Mateus em RL para LLMs: o RL melhora o desempenho em proporção à competência inicial—tarefas fáceis ficam mais fáceis, tarefas difíceis permanecem difíceis.

Causas? Não apenas GRPO. Se não houver resposta correta em k amostras, não há gradiente. Uma solução: amostrar mais completações (k maior). Testamos com Qwen 2.5 0.5B Instruct no GSM8k platinum, variando k.