HeadlinesBriefing favicon HeadlinesBriefing.com

LLM — не просто предсказатели следующего токена

Hacker News •
×

Строго говоря, утверждение «LLM — это предсказатели следующего токена» не является ошибочным, но оно неполно. Это хорошее приближение нулевого порядка, и оно основано на реальном факте: языковые модели на основе трансформеров генерируют токены авторегрессионно. Во время предварительного обучения модель многократно берёт несколько предыдущих токенов, смотрит на токен, который действительно следовал за ними, и делает этот токен более вероятным для выборки следующим.

Ключевой момент: каждый реальный следующий токен берётся из существующей последовательности в обучающих данных. Вероятно, справедливо сказать, что базовая модель также ведёт себя как предсказатель следующего токена. Но LLM, которые мы используем, — это не просто базовые модели. Они проходят пост-обучение, и ключевая часть современного пост-обучения — это обучение с подкреплением на основе проверяемых вознаграждений (RLVR). Во время предварительного обучения модель учится только на последовательностях, которые уже существуют в обучающих данных. Во время RLVR модель исследует, генерируя новые последовательности и учась на их результатах.

Аналогия с шахматами делает это различие более наглядным. Первая система обучается на большой базе партий гроссмейстеров и предсказывает ход, который гроссмейстер, скорее всего, сделает следующим. Вторая — это идеализированный шахматный движок, который исследовал все возможные партии и выбирает ход, ведущий к наибольшей вероятности победы. Назвать вторую систему «предсказателем следующего хода» было бы странно.

Другие методы пост-обучения также важны. Обучение с подкреплением на основе обратной связи от человека (RLHF) смещает модель в сторону имитации полезного ассистента. RLVR идёт дальше: он позволяет LLM исследовать и учиться на своих собственных сгенерированных последовательностях.