HeadlinesBriefing favicon HeadlinesBriefing.com

RL для LLM: Эффект Матфея и Никогда не сдавайся

Hacker News •
×

В этом посте блога обсуждается статья о пост-обучении с RL для LLM, вводится Эффект Матфея и предлагается 'Никогда не сдавайся' для его решения. Автор представляет интерактивно, с более глубокими техническими деталями в статье и коде.

Каждый практик RL видел, как кривая оценки растет, как AIME 2025 во время обучения Olmo 3.1 RL-Zero Math. Но что это значит? Разбив 30 вопросов AIME на уровни сложности на основе начального pass@32, мы обнаруживаем, что легкие задачи значительно улучшаются, а сложные задачи (начальный pass@32=0) почти не улучшаются. Усреднение скрыло это: улучшения происходят за счет более легких задач. Это Эффект Матфея.

Мы видим подобное в RL для кода и агентном RL с использованием Deepcoder и Deep SWE. Улучшения пропорциональны начальной компетентности. Мы связываем это с Эффектом Матфея в сетевой науке и экономике: 'богатые становятся богаче'. Эффект Матфея в RL для LLM: RL улучшает производительность пропорционально начальной компетентности—легкие задачи становятся легче, сложные задачи остаются сложными.

Причины? Не только GRPO. Если нет правильного ответа в k выборках, нет градиента. Одно решение: выбирать больше завершений (большее k). Мы тестируем с Qwen 2.5 0.5B Instruct на GSM8k platinum, варьируя k.