HeadlinesBriefing favicon HeadlinesBriefing.com

GRPO treina modelos pequenos

Towards Data Science •
×

Um modelo de linguagem pode escrever 'let me double-check that' e ainda errar na multiplicação. Pode até escrever 'wait, let me reconsider,' e cair em uma resposta errada diferente. Nenhuma dessas frases é evidência de pensamento.

Se o objetivo é resolver o problema, apenas o número final conta. Deep Seek's R1-Zero chamou considerável atenção ao reinforcement learning sem uma etapa preliminar de fine-tuning supervisionado. Seus pesquisadores relataram comportamentos como revisitar uma abordagem e gastar mais tokens em problemas difíceis.

Deep Seek-R1, em contraste, usou um pipeline de treinamento mais amplo, incluindo dados cold-start, então não devemos tratar os dois processos de treinamento como interchangeáveis. O que mais me interessa sobre o Group Relative Policy Optimization, ou GRPO como a maioria de nós conhece, é quão pouco feedback o setup básico precisa. Um modelo pode gerar várias tentativas a uma pergunta, receber uma pontuação para cada uma, e usar as diferenças para ajustar seu comportamento.

Mesmo que possamos verificar a resposta final sem escrever a solução que queremos que ela imite. Combinado com técnicas que reduzem a memória de treinamento, isso torna experimentos de raciocínio menores mais acessíveis. Isso deixa duas coisas dignas de entender antes de escolher um modelo ou uma GPU: como essas pontuam guiam uma atualização, e o que acontece quando a regra de pontuação recompensa o errado.

Um exemplo simples de aritmética ajuda a explicar ambos. Considere quatro respostas possíveis para a mesma pergunta e como uma função de recompensa pontuaria cada uma. Um problema com uma resposta que podemos verificar: Uma loja tem 6 caixas com 8 itens em cada caixa.

Vende 6 itens. Quantos itens restam? A resposta é 42. Uma expressão Python pode verificar isso.

Agora, essa simples verificação nos dá algo valioso: uma forma independente de pontuar a resposta final. Não precisamos de outro modelo de linguagem para decidir se a resposta soa convincente. Em um conjunto de dados de treinamento, a pergunta vai ao modelo enquanto a resposta esperada fica com o verificador.

O modelo gera uma resposta, o verificador pontua, e o algoritmo de treinamento usa essa pontuação para ajustar o comportamento do modelo. Fácil. Portanto, podemos usar pares de perguntas e respostas sem fornecer soluções trabalhadas como alvos de treinamento supervisionado.

Esse é o apelo do reinforcement learning com recompensas verificáveis: o feedback pode vir de verificar um resultado. Para um sistema de inventário real, a aritmética ordinária ainda é a solução sensata. O modelo de linguagem seria um calculadora cara com opiniões.

Aqui, o exemplo torna o mecanismo de aprendizado fácil de inspecionar. Isso também mostra onde nosso verificador falha, porque verificar se o inteiro final está correto não nos diz se o raciocínio por trás dele faz sentido. GRPO foi introduzido no trabalho Deep Seek Math como alternativa aos requisitos de memória do treinamento PPO convencional.

Implementações comuns de actor-critic PPO treinam um estimador de valor, frequentemente chamado de critic, junto com a política. Esse estimador fornece uma base para julgar o resultado de uma ação. GRPO obtém sua baseline de um grupo de respostas amostradas para o mesmo prompt.

Em vez de perguntar a um critic separado para estimar o quanto o modelo deve fazer bem, ele compara como várias tentativas realmente fizeram. Imagine o modelo produzir estas quatro respostas: Tentativa Resposta final Prêmio de correção 1 42 1, 2 24 0, 3 42 1, 4 48 0. A recompensa média do grupo é 0,5.

Os intentos 1 e 3 performaram melhor que essa média; os intentos 2 e 4 performaram pior. A formulação original de recompensa baseada em resultados padroniza essa comparação: [Ai=ri−rˉσr+ϵ]. Isso indica que os intentos 1 e 3 têm recompensas standardizadas superiores a 0, enquanto os intentos 2 e 4 têm recompensas standardizadas inferiores a 0.

Dessa forma, GRPO usa a comparação de um grupo de respostas para guiar a atualização do modelo, sem necessidade de critic externo.