HeadlinesBriefing favicon HeadlinesBriefing.com

RL pour les LLMs : L'Effet Matthieu et Ne jamais abandonner

Hacker News •
×

Cet article de blog discute d'un article sur le post-entraînement RL des LLMs, présente l'Effet Matthieu et propose 'Ne jamais abandonner' pour le résoudre. L'auteur présente de manière interactive, avec des détails techniques plus approfondis dans l'article et le code.

Chaque praticien du RL a vu une courbe d'évaluation monter, comme AIME 2025 pendant l'entraînement d'Olmo 3.1 RL-Zero Math. Mais qu'est-ce que cela signifie ? En divisant 30 questions AIME en niveaux de difficulté selon le pass@32 initial, nous constatons que les problèmes faciles s'améliorent drastiquement, tandis que les problèmes difficiles (pass@32 initial=0) s'améliorent à peine. La moyenne a caché cela : les gains proviennent de problèmes plus faciles. C'est l'Effet Matthieu.

Nous observons la même chose en RL de code et en RL agentique avec Deepcoder et Deep SWE. Les gains sont proportionnels à la compétence initiale. Nous relions cela à l'Effet Matthieu en science des réseaux et en économie : 'les riches s'enrichissent'. L'Effet Matthieu en RL pour les LLMs : le RL améliore les performances proportionnellement à la compétence initiale—les tâches faciles deviennent plus faciles, les tâches difficiles restent difficiles.

Causes ? Pas seulement GRPO. S'il n'y a pas de réponse correcte dans k échantillons, pas de gradient. Une solution : échantillonner plus de complétions (k plus grand). Nous testons avec Qwen 2.5 0.5B Instruct sur GSM8k platinum, en variant k.

FAQ : Qu'est-ce que l'Effet Matthieu en RL pour les LLMs ?

L'Effet Matthieu en RL pour les LLMs décrit comment le RL améliore les performances sur une tâche proportionnellement à la compétence initiale d'un modèle—rendant les tâches faciles plus faciles tandis que les tâches difficiles restent souvent difficiles.

FAQ Q : Qu'est-ce que l'Effet Matthieu en RL pour les LLMs ?

FAQ A : L'Effet Matthieu en RL pour les LLMs décrit comment le RL améliore les performances sur une tâche proportionnellement à la compétence initiale d'un modèle—rendant les tâches faciles plus faciles tandis que les tâches difficiles restent souvent difficiles.