HeadlinesBriefing favicon HeadlinesBriefing.com

Qu'est-ce que RLCD ? Le secret derrière Jev

Hacker News •
×

De la modélisation des récompenses par paires aux décisions multivole calibrées, Jev semble mystérieux lorsqu'il est vu comme une alternative à un modèle de langage. Il devient beaucoup plus simple lorsqu'il est vu comme la prochaine étape de la modélisation des récompenses. L'idée centrale est : RLCD = modélisation des préférences multivole + calibrage des probabilités. Plus spécifiquement, RLCD est un objectif de Plackett–Luce conditionné par schéma. Jev transforme cet objectif en un produit en ajoutant des sorties typées et une inférence parallèle. C'est le secret : le modèle de récompense n'est plus caché derrière un générateur. Le modèle de récompense devient le modèle.

La modélisation des récompenses a commencé avec un scalaire. Un modèle de récompense conventionnel reçoit un contexte et une réponse candidate, puis produit un scalaire. Les modèles de récompense de résultat notent la réponse finale. Les modèles de récompense de processus notent les étapes de raisonnement individuelles. Dans les deux cas, l'objet appris est un nombre d'apparence absolue. Le problème est que ce nombre n'est pas réellement absolu. Une récompense de 0.8 n'a pas de signification stable à travers les problèmes, les pools de candidats, les points de contrôle ou les familles de modèles. Elle est principalement utile pour comparer des candidats générés dans des conditions similaires. Le signal opérationnel a toujours été la préférence relative.

PPRM a rendu la préférence explicite. Le modèle de récompense de préférence par paires de LLaMA-Berry, ou PPRM, expose directement la comparaison. Étant donné un problème et deux solutions, PPRM répond : La première réponse est-elle meilleure que la seconde ? C'est le modèle Bradley–Terry. LLaMA-Berry implémente la comparaison comme une décision de modèle de langage contrainte sur les jetons Oui et Non. Il entraîne l'évaluateur sur près de 7,8 millions de paires de solutions mathématiques et utilise DPO pour améliorer la tâche de prédiction par paires. Le changement essentiel est conceptuel : la modélisation des récompenses devient une modélisation de la probabilité de préférence.

Plackett–Luce est le PPRM multivole. PPRM compare deux candidats. Une interface de décision réelle en reçoit généralement plus de deux. Attribuez à chaque candidat une utilité dépendante du contexte, puis normalisez tous les candidats ensemble. C'est le modèle de choix de Luce, également connu sous le nom de logit multinomial. Lorsque K=2, il se réduit exactement à Bradley–Terry. PPRM est donc le cas binaire de la même géométrie de choix. Si la supervision contient un classement complet, la vraisemblance complète de Plackett–Luce sélectionne de manière répétée le prochain meilleur candidat restant.

Entités clés : Entreprises : LLaMA-Berry

FAQ : Qu'est-ce que RLCD ?

RLCD est un objectif de Plackett–Luce conditionné par schéma qui combine la modélisation des préférences multivole avec le calibrage des probabilités, transformant le modèle de récompense en le modèle lui-même.

FAQ Q : Qu'est-ce que RLCD ?

FAQ A : RLCD est un objectif de Plackett–Luce conditionné par schéma qui combine la modélisation des préférences multivole avec le calibrage des probabilités, transformant le modèle de récompense en le modèle lui-même.