HeadlinesBriefing favicon HeadlinesBriefing.com

GRPO обучает маленькие модели

Towards Data Science •
×

Языковая модель может написать «let me double-check that» и всё равно ошибиться в умножении. Она может даже написать «wait, let me reconsider,» и прийти к другому неверному ответу. Ни одна из этих фраз не является доказательством мышления. Если цель — решить задачу, то важно только число в конце. Deep Seek's R1-Zero привлек considerable attention к обучению с подкреплением без предварительного этапа supervised fine-tuning. Его исследователи сообщили о поведениях, таких как возвращение к подходу и трата большего числа токенов на сложные задачи. Deep Seek-R1, наоборот, использова более широкий тренировочный пайплайн, включая cold-start данные, поэтому мы не должны считать два процесса обучения взаимозаменяемыми. То, что больше всего меня интересует в Group Relative Policy Optimization, или GRPO, как знают большинство из нас, — это то, сколько мало обратной связи нужно базовой настройке. Модель может сгенерировать несколько попыток вопроса, получить оценку для каждой и использовать различия для корректировки своего поведения. Даже можно проверить правильный ответ, не пиша решение, которое мы хотим, чтобы оно имитировало. В сочетании с техниками, уменьшающими память обучения, это делает более доступными более мелкие эксперименты по рассуждениям. Остаются две вещи, которые стоит понять перед выбором модели или GPU: как эти оценки руководят обновлением, и что происходит, когда правило награды вознаграждает не то. Простой арифметический пример помогает объяснить оба варианта. Рассмотрим четыре возможных ответа на один и тот же вопрос и как функция награды будет оценивать каждый из них. Проблема с ответом, который мы можем проверить: В магазине 6 коробок по 8 предметов в каждой. Продано 6 предметов. Сколько предметов осталось? Ответ: 42. Выражение Python может это проверить. Теперь, эта простая проверка дает нам что-то ценное: независимый способ оценить правильный ответ. Нам не нужен другой языковой модели, чтобы решить, звучит ли ответ убедительно. В обучающей выборке вопрос попадает модели, а ожидаемый ответ остается с проверяющим. Модель генерирует ответ, проверяющий оценивает его, и алгоритм обучения использует эту оценку для корректировки поведения модели. Просто. Поэтому мы можем использовать пары вопрос-ответ без предоставления развернутых решений в качестве supervised targets. Это привлекательность обучения с подкреплением с проверяемыми наградами: обратная связь может поступать от проверки результата. Для реальной системы инвентаризации