Групповая относительная оптимизация политики (GRPO) стала перспективным подходом для обучения агентов больших языковых моделей. Однако её равномерное присвоение преимуществ на уровне траектории всем токенам политики не позволяет различать важные решения и менее значимые, скрывая, какие промежуточные решения способствовали успеху.
Мы представляем Pro Ver, фреймворк, который нацеливается на потенциально ключевые решения для точного распределения кредита в агентном обучении с подкреплением. Для данной группы развёртывания агентный судья сравнивает успешные и неудачные траектории, предлагая сегмент, потенциально ответственный за их расходящиеся результаты. Вместо того чтобы напрямую доверять оценке судьи, Pro Ver проверяет предложенный сегмент, оценивая его преимущество по разнице в конечных показателях успеха между продолжениями текущей политики, выбранными до и после сегмента.
Положительные оценки затем включаются в преимущества GRPO для токенов политики в пределах предложенного сегмента. Используя суждение модели только для выбора места проверки, Pro Ver обосновывает локальный кредит на наблюдаемых результатах без исчерпывающей оценки каждого промежуточного состояния. На ALFWorld, Web Shop и Search QA Pro Ver достигает наилучшей средней производительности на обоих масштабах моделей с относительными улучшениями по сравнению с GRPO на 9,91% и 7,12% для Qwen3.5-2B и Qwen3.5-4B соответственно.
Ключевые сущности: Люди: Dongwon Jung
Часто задаваемый вопрос: В чём основной вклад Pro Ver?
Pro Ver выборочно нацеливается и проверяет ключевые решения в агентном обучении с подкреплением, улучшая распределение кредита без исчерпывающей оценки.
ЧЗВ В: В чём основной вклад Pro Ver?
ЧЗВ О: Pro Ver выборочно нацеливается и проверяет ключевые решения в агентном обучении с подкреплением, улучшая распределение кредита без исчерпывающей оценки.
Источник: Hacker News · Сводку подготовил HeadlinesBriefing