HeadlinesBriefing favicon HeadlinesBriefing.com

LLM不仅仅是下一个词预测器

Hacker News •
×

严格来说,“LLM是下一个词预测器”这种说法并不错,但不够完整。这是一个很好的零阶近似,而且有真实依据:基于Transformer的语言模型确实是自回归地逐个生成词元。在预训练阶段,模型反复获取一些先前的词元,观察实际跟随它们的词元,并提高该词元被采样的概率。

关键在于,每一个实际的后续词元都来自训练数据中已有的序列。可以说,基础模型的行为也像一个下一个词预测器。但我们使用的LLM不仅仅是基础模型。它们经过了后训练,而现代后训练的一个关键部分是使用可验证奖励的强化学习(RLVR)。在预训练阶段,模型只从训练数据中已有的序列中学习。而在RLVR阶段,模型通过生成新序列并从其结果中学习来进行探索。

用国际象棋来类比,这个区别更容易理解。第一个系统是在大量大师对局数据库上训练的,它预测大师下一步最可能走哪一步。第二个系统是一个理想化的国际象棋引擎,它探索了所有可能的对局,并选择导致最高获胜概率的那一步。称第二个系统为“下一步走法预测器”会很奇怪。

其他后训练技术也很重要。基于人类反馈的强化学习(RLHF)使模型趋向于模拟一个乐于助人的助手。而RLVR更进一步:它允许LLM探索并从自己生成的序列中学习。

常见问题解答:为什么说LLM不仅仅是下一个词预测器是不完整的?

虽然LLM是自回归地生成词元,但通过RLVR的后训练使它们能够从探索生成的新序列中学习,而不仅仅是已有的数据。这使得它们更像是为奖励而优化的决策者,而不仅仅是简单的预测器。