HeadlinesBriefing favicon HeadlinesBriefing.com

什么是RLCD?Jev背后的秘密

Hacker News •
×

从成对奖励建模到校准的多路决策,Jev作为语言模型的替代品看起来神秘。当被视为奖励建模的下一步时,它变得简单得多。核心思想是:RLCD = 多路偏好建模 + 概率校准。更具体地说,RLCD是一种模式条件的Plackett–Luce目标。Jev通过添加类型化输出和并行推理将该目标转化为产品。这就是秘密:奖励模型不再隐藏在生成器后面。奖励模型变成了模型本身。

奖励建模始于标量。传统的奖励模型接收上下文和候选答案,然后产生标量。结果奖励模型对最终答案评分。过程奖励模型对单个推理步骤评分。在这两种情况下,学习到的对象是一个看似绝对的数值。问题是这个数值实际上并不绝对。0.8的奖励在不同问题、候选池、检查点或模型家族中没有稳定的含义。它主要用于比较在类似条件下生成的候选。操作信号始终是相对偏好。

PPRM使偏好显式化。LLaMA-Berry的成对偏好奖励模型(PPRM)直接暴露了比较。给定一个问题及两个解决方案,PPRM回答:第一个答案是否优于第二个答案?这是Bradley–Terry模型。LLaMA-Berry将比较实现为对Yes和No标记的约束语言模型决策。它在近780万个数学解对上训练评估器,并使用DPO改进成对预测任务。本质变化是概念性的:奖励建模变成了偏好概率建模。

Plackett–Luce是多路PPRM。PPRM比较两个候选。实际决策接口通常接收多于两个。为每个候选分配上下文相关的效用,然后一起归一化所有候选。这是Luce选择模型,也称为多项logit。当K=2时,它精确简化为Bradley–Terry。因此,PPRM是相同选择几何的二元情况。如果监督包含完整排名,完整的Plackett–Luce似然会重复选择下一个最佳剩余候选。

关键实体:公司:LLaMA-Berry

FAQ:什么是RLCD?

RLCD是一种模式条件的Plackett–Luce目标,结合了多路偏好建模与概率校准,将奖励模型本身转化为模型。

FAQ Q:什么是RLCD?

FAQ A:RLCD是一种模式条件的Plackett–Luce目标,结合了多路偏好建模与概率校准,将奖励模型本身转化为模型。