HeadlinesBriefing favicon HeadlinesBriefing.com

¿Qué es RLCD? El secreto detrás de Jev

Hacker News •
×

Desde el modelado de recompensas por pares hasta decisiones multivía calibradas, Jev parece misterioso cuando se ve como una alternativa a un modelo de lenguaje. Se vuelve mucho más simple cuando se ve como el siguiente paso en el modelado de recompensas. La idea central es: RLCD = modelado de preferencias multivía + calibración de probabilidad. Más específicamente, RLCD es un objetivo de Plackett–Luce condicionado por esquema. Jev convierte ese objetivo en un producto agregando salidas tipadas e inferencia paralela. Ese es el secreto: el modelo de recompensa ya no está oculto detrás de un generador. El modelo de recompensa se convierte en el modelo.

El modelado de recompensas comenzó con un escalar. Un modelo de recompensa convencional recibe un contexto y una respuesta candidata, luego produce un escalar. Los modelos de recompensa de resultado puntúan la respuesta final. Los modelos de recompensa de proceso puntúan pasos de razonamiento individuales. En ambos casos, el objeto aprendido es un número de apariencia absoluta. El problema es que este número no es realmente absoluto. Una recompensa de 0.8 no tiene un significado estable entre problemas, grupos de candidatos, puntos de control o familias de modelos. Es útil principalmente para comparar candidatos generados bajo condiciones similares. La señal operativa siempre fue la preferencia relativa.

PPRM hizo explícita la preferencia. El Modelo de Recompensa de Preferencia por Pares de LLaMA-Berry, o PPRM, expone la comparación directamente. Dado un problema y dos soluciones, PPRM responde: ¿Es la primera respuesta mejor que la segunda? Este es el modelo Bradley–Terry. LLaMA-Berry implementa la comparación como una decisión de modelo de lenguaje restringida sobre tokens Sí y No. Entrena al evaluador en casi 7.8 millones de pares de soluciones matemáticas y usa DPO para mejorar la tarea de predicción por pares. El cambio esencial es conceptual: el modelado de recompensas se convierte en modelado de probabilidad de preferencia.

Plackett–Luce es el PPRM multivía. PPRM compara dos candidatos. Una interfaz de decisión real generalmente recibe más de dos. Asigna a cada candidato una utilidad dependiente del contexto, luego normaliza todos los candidatos juntos. Este es el modelo de elección de Luce, también conocido como logit multinomial. Cuando K=2, se reduce exactamente a Bradley–Terry. Por lo tanto, PPRM es el caso binario de la misma geometría de elección. Si la supervisión contiene una clasificación completa, la verosimilitud completa de Plackett–Luce selecciona repetidamente el siguiente mejor candidato restante.

Entidades clave: Empresas: LLaMA-Berry