HeadlinesBriefing favicon HeadlinesBriefing.com

GRPO 训练小型语言模型可验证奖励

Towards Data Science •
×

语言模型可以写下‘让我再核对一下’,但乘法仍然算错。它甚至可以写下‘等等,让我重新考虑’,并得出不同错误的答案。这两句话都不是思考的证据。如果目标是解决问题,只有最后的数字才算数。Deep Seek 的 R1-Zero 给强化学习在预备监督微调阶段之前引起了相当大的关注。其研究人员报告了诸如重新审视方法和在难题上花费更多 token 等行为。相比之下,Deep Seek-R1 使用了更广泛的训练管道,包括冷启动数据,所以我们不应将这两种训练过程互换。最让我感兴趣的是 Group Relative Policy Optimization,也就是大多数人所熟知的 GRPO。它的基本设置需要的反馈非常少。模型可以对一个问题生成几次尝试,为每次尝试获得一个分数,并利用差异来调整其行为。即使不写出想要它模仿的解,我们也可以通过检查最终答案来验证。结合减少训练内存的技术,这使得更小的推理实验更易于访问。这留下了两件在选择模型或 GPU 之前值得理解的事情:这些分数如何指导更新,以及当评分规则奖励错误的事情时会发生什么。一个简单的算术例子有助于解释两者。考虑四个对同一个问题的可能回答,以及奖励函数如何对每个回答进行评分。一个答案可以检查的问题:一家商店有 6 个盒子,每个盒子有 8 件物品。它卖出 6 件物品。还剩多少件物品?答案是 42。一个 Python 表达式可以验证它。现在,这个简单的检查给了我们 something valuable:验证最终答案的独立方法。我们不需要另一个语言模型来决定回复是否听起来令人信服。在训练数据集中,问题发送给模型,预期答案留在验证器中。模型生成回复,验证器对其进行评分,训练算法使用该分数来调整模型的行为。很简单。因此,我们可以在不提供作为监督目标的已完成解的问答对的情况下使用问题和答案对。强化学习与可验证奖励的吸引力在于:反馈可以来自验证结果。对于真实的库存系统,普通算术仍然是明智的解决方案。语言模型将是一个带有观点的昂贵计算器。在这里,例子使学习机制易于检查。这也展示了我们的验证器的局限性,因为检查最终整数是否正确并不能告诉我们背后的推理是否合理。GRPO 在 Deep Seek Math 工作中被介绍为传统 PPO 基训的替代方案,以解决传统 PPO 培训的内存要求。常见的 actor-critic PPO 实现训练一个价值估计器,通常称为 critic,与策略一起训练。该估计器为判断行动的成果提供基线。GRPO 从为同一提示采样的一组响应中获得其基线。而不是询问单独的 critic 来估计模型应该做得多好,它将几次实际尝试的好坏进行比较。想象模型产生这些四个答案:尝试 最终答案 正确性奖励 1 42 1,2 24 0,3 42 1,4 48 0。该组的平均奖励是 0.5。尝试 1 和 3 的表现优于平均值;尝试 2 和 4 的表现低于平均值。原始的基于结果的奖励公式对该比较进行了标准化:[Ai=ri−rˉσr+ϵ]。这表明尝试 1 和 3 的标准化奖励高于 0,而尝试 2 和 4 的标准化奖励低于 0。通过这种方式,GRPO 利用一组响应的比较来指导模型更新,而无需外部 critic。