HeadlinesBriefing favicon HeadlinesBriefing.com

Was ist RLCD? Das Geheimnis hinter Jev

Hacker News •
×

Von paarweiser Belohnungsmodellierung zu kalibrierten Multiway-Entscheidungen wirkt Jev geheimnisvoll, wenn es als Alternative zu einem Sprachmodell betrachtet wird. Es wird viel einfacher, wenn es als nächster Schritt in der Belohnungsmodellierung betrachtet wird. Die Kernidee ist: RLCD = Multiway-Präferenzmodellierung + Wahrscheinlichkeitskalibrierung. Genauer gesagt ist RLCD ein schema-konditioniertes Plackett–Luce-Ziel. Jev verwandelt dieses Ziel in ein Produkt, indem es typisierte Ausgaben und parallele Inferenz hinzufügt. Das ist das Geheimnis: Das Belohnungsmodell ist nicht länger hinter einem Generator versteckt. Das Belohnungsmodell wird zum Modell.

Die Belohnungsmodellierung begann mit einem Skalar. Ein herkömmliches Belohnungsmodell empfängt einen Kontext und eine Kandidatenantwort und erzeugt dann einen Skalar. Ergebnis-Belohnungsmodelle bewerten die endgültige Antwort. Prozess-Belohnungsmodelle bewerten einzelne Denkschritte. In beiden Fällen ist das gelernte Objekt eine absolut aussehende Zahl. Das Problem ist, dass diese Zahl nicht wirklich absolut ist. Eine Belohnung von 0.8 hat keine stabile Bedeutung über Probleme, Kandidatenpools, Checkpoints oder Modellfamilien hinweg. Sie ist hauptsächlich nützlich, um Kandidaten zu vergleichen, die unter ähnlichen Bedingungen generiert wurden. Das operative Signal war immer die relative Präferenz.

PPRM machte die Präferenz explizit. Das Pairwise Preference Reward Model von LLaMA-Berry, oder PPRM, legt den Vergleich direkt offen. Bei einem Problem und zwei Lösungen antwortet PPRM: Ist die erste Antwort besser als die zweite Antwort? Dies ist das Bradley–Terry-Modell. LLaMA-Berry implementiert den Vergleich als eine eingeschränkte Sprachmodellentscheidung über Ja- und Nein-Token. Es trainiert den Evaluator auf fast 7,8 Millionen mathematischen Lösungspaaren und verwendet DPO, um die paarweise Vorhersageaufgabe zu verbessern. Die wesentliche Änderung ist konzeptionell: Belohnungsmodellierung wird zu Präferenz-Wahrscheinlichkeitsmodellierung.

Plackett–Luce ist der Multiway-PPRM. PPRM vergleicht zwei Kandidaten. Eine echte Entscheidungsschnittstelle empfängt normalerweise mehr als zwei. Weisen Sie jedem Kandidaten einen kontextabhängigen Nutzen zu, dann normalisieren Sie alle Kandidaten zusammen. Dies ist das Luce-Auswahlmodell, auch bekannt als multinomiales Logit. Wenn K=2, reduziert es sich exakt auf Bradley–Terry. PPRM ist daher der binäre Fall derselben Auswahlgeometrie. Wenn die Überwachung eine vollständige Rangfolge enthält, wählt die vollständige Plackett–Luce-Wahrscheinlichkeit wiederholt den nächstbesten verbleibenden Kandidaten aus.

Schlüsselentitäten: Unternehmen: LLaMA-Berry