HeadlinesBriefing favicon HeadlinesBriefing.com

RLCDとは?Jevの背後にある秘密

Hacker News •
×

ペアワイズ報酬モデリングからキャリブレーションされた多方向決定まで、Jevは言語モデルの代替として見ると神秘的に見えます。報酬モデリングの次のステップとして見ると、はるかに単純になります。核となるアイデアは次のとおりです:RLCD = 多方向選好モデリング + 確率キャリブレーション。より具体的には、RLCDはスキーマ条件付きPlackett–Luce目的関数です。Jevは、型付き出力と並列推論を追加することで、その目的関数を製品に変えます。それが秘密です:報酬モデルはもはやジェネレーターの背後に隠されていません。報酬モデルがモデルそのものになります。

報酬モデリングはスカラーから始まりました。従来の報酬モデルは、コンテキストと候補回答を受け取り、スカラーを生成します。結果報酬モデルは最終回答をスコアリングします。プロセス報酬モデルは個々の推論ステップをスコアリングします。どちらの場合も、学習されるオブジェクトは絶対的に見える数値です。問題は、この数値が実際には絶対的ではないことです。0.8の報酬は、問題、候補プール、チェックポイント、モデルファミリー間で安定した意味を持ちません。主に類似した条件下で生成された候補を比較するのに役立ちます。運用上の信号は常に相対的な選好でした。

PPRMは選好を明示的にしました。LLaMA-Berryのペアワイズ選好報酬モデル(PPRM)は、比較を直接公開します。問題と2つの解決策が与えられると、PPRMは次のように答えます:最初の回答は2番目の回答より優れていますか?これはBradley–Terryモデルです。LLaMA-Berryは、比較をYesトークンとNoトークンに対する制約付き言語モデル決定として実装します。評価器を約780万の数学的解決策ペアでトレーニングし、DPOを使用してペアワイズ予測タスクを改善します。本質的な変化は概念的です:報酬モデリングは選好確率モデリングになります。

Plackett–Luceは多方向PPRMです。PPRMは2つの候補を比較します。実際の決定インターフェースは通常、2つ以上を受け取ります。各候補にコンテキスト依存の効用を割り当て、すべての候補を一緒に正規化します。これがLuce選択モデルであり、多項ロジットとしても知られています。K=2の場合、正確にBradley–Terryに還元されます。したがって、PPRMは同じ選択ジオメトリのバイナリケースです。監視に完全なランキングが含まれている場合、完全なPlackett–Luce尤度は、次に最良の残りの候補を繰り返し選択します。

主要エンティティ:企業:LLaMA-Berry

FAQ:RLCDとは?

RLCDは、スキーマ条件付きPlackett–Luce目的関数であり、多方向選好モデリングと確率キャリブレーションを組み合わせ、報酬モデルをモデル自体に変えます。

FAQ Q:RLCDとは?

FAQ A:RLCDは、スキーマ条件付きPlackett–Luce目的関数であり、多方向選好モデリングと確率キャリブレーションを組み合わせ、報酬モデルをモデル自体に変えます。