HeadlinesBriefing favicon HeadlinesBriefing.com

Что такое RLCD? Секрет Jev

Hacker News •
×

От попарного моделирования вознаграждений до калиброванных многопутевых решений Jev выглядит загадочно, если рассматривать его как альтернативу языковой модели. Он становится намного проще, если рассматривать его как следующий шаг в моделировании вознаграждений. Основная идея: RLCD = многопутевое моделирование предпочтений + калибровка вероятностей. Более конкретно, RLCD — это обусловленная схемой цель Plackett–Luce. Jev превращает эту цель в продукт, добавляя типизированные выходы и параллельный вывод. В этом и заключается секрет: модель вознаграждения больше не скрыта за генератором. Модель вознаграждения становится самой моделью.

Моделирование вознаграждений началось со скаляра. Обычная модель вознаграждения получает контекст и ответ-кандидат, затем выдает скаляр. Модели вознаграждения результата оценивают окончательный ответ. Модели вознаграждения процесса оценивают отдельные шаги рассуждения. В обоих случаях изучаемый объект — это число, которое выглядит абсолютным. Проблема в том, что это число на самом деле не абсолютное. Вознаграждение 0.8 не имеет стабильного значения для разных задач, пулов кандидатов, контрольных точек или семейств моделей. Оно в основном полезно для сравнения кандидатов, сгенерированных в аналогичных условиях. Операционным сигналом всегда было относительное предпочтение.

PPRM сделал предпочтение явным. Попарная модель вознаграждения предпочтений LLaMA-Berry, или PPRM, напрямую раскрывает сравнение. При задании задачи и двух решений PPRM отвечает: Является ли первый ответ лучше второго? Это модель Bradley–Terry. LLaMA-Berry реализует сравнение как ограниченное решение языковой модели по токенам Да и Нет. Он обучает оценщика на почти 7,8 миллионах пар математических решений и использует DPO для улучшения задачи попарного прогнозирования. Существенное изменение является концептуальным: моделирование вознаграждений становится моделированием вероятности предпочтений.

Plackett–Luce — это многопутевой PPRM. PPRM сравнивает двух кандидатов. Реальный интерфейс принятия решений обычно получает более двух. Назначьте каждому кандидату полезность, зависящую от контекста, затем нормализуйте всех кандидатов вместе. Это модель выбора Luce, также известная как мультиномиальный логит. Когда K=2, она сводится в точности к Bradley–Terry. Таким образом, PPRM — это бинарный случай той же геометрии выбора. Если супервизия содержит полный рейтинг, полная вероятность Plackett–Luce многократно выбирает следующего лучшего оставшегося кандидата.

Ключевые сущности: Компании: LLaMA-Berry