HeadlinesBriefing favicon HeadlinesBriefing.com

O que é RLCD? O segredo por trás do Jev

Hacker News •
×

Da modelagem de recompensas por pares a decisões multivias calibradas, Jev parece misterioso quando visto como uma alternativa a um modelo de linguagem. Torna-se muito mais simples quando visto como o próximo passo na modelagem de recompensas. A ideia central é: RLCD = modelagem de preferência multivias + calibração de probabilidade. Mais especificamente, RLCD é um objetivo Plackett–Luce condicionado por esquema. Jev transforma esse objetivo em um produto adicionando saídas tipadas e inferência paralela. Esse é o segredo: o modelo de recompensa não está mais escondido atrás de um gerador. O modelo de recompensa se torna o modelo.

A modelagem de recompensas começou com um escalar. Um modelo de recompensa convencional recebe um contexto e uma resposta candidata, então produz um escalar. Modelos de recompensa de resultado pontuam a resposta final. Modelos de recompensa de processo pontuam etapas de raciocínio individuais. Em ambos os casos, o objeto aprendido é um número de aparência absoluta. O problema é que esse número não é realmente absoluto. Uma recompensa de 0.8 não tem um significado estável entre problemas, pools de candidatos, checkpoints ou famílias de modelos. É útil principalmente para comparar candidatos gerados sob condições semelhantes. O sinal operacional sempre foi a preferência relativa.

PPRM tornou a preferência explícita. O Modelo de Recompensa de Preferência por Pares do LLaMA-Berry, ou PPRM, expõe a comparação diretamente. Dado um problema e duas soluções, PPRM responde: A primeira resposta é melhor que a segunda? Este é o modelo Bradley–Terry. LLaMA-Berry implementa a comparação como uma decisão de modelo de linguagem restrita sobre tokens Sim e Não. Ele treina o avaliador em quase 7,8 milhões de pares de soluções matemáticas e usa DPO para melhorar a tarefa de previsão por pares. A mudança essencial é conceitual: a modelagem de recompensas se torna modelagem de probabilidade de preferência.

Plackett–Luce é o PPRM multivias. PPRM compara dois candidatos. Uma interface de decisão real geralmente recebe mais de dois. Atribua a cada candidato uma utilidade dependente do contexto, depois normalize todos os candidatos juntos. Este é o modelo de escolha de Luce, também conhecido como logit multinomial. Quando K=2, ele se reduz exatamente a Bradley–Terry. Portanto, PPRM é o caso binário da mesma geometria de escolha. Se a supervisão contiver uma classificação completa, a verossimilhança completa de Plackett–Luce seleciona repetidamente o próximo melhor candidato restante.

Entidades-chave: Empresas: LLaMA-Berry