HeadlinesBriefing favicon HeadlinesBriefing.com

GRPO entraîne des petits modèles

Towards Data Science •
×

Un modèle de langage peut écrire "let me double-check that" et se tromper tout de même en multiplication. Il peut même écrire "wait, let me reconsider," et atterrer sur une mauvaise réponse différente. Aucune de ces phrases n'est une preuve de pensée.

Si l'objectif est de résoudre le problème, seul le nombre final compte. Deep Seek's R1-Zero a attiré une attention considérable sur l'apprentissage par renforcement sans étape de fine-tuning supervisé préalable. Ses chercheurs ont signalé des comportements tels que revisiter une approche et dépenser plus de tokens sur des problèmes difficiles.

Deep Seek-R1, au contraire, a utilisé un pipeline d'entraînement plus large, incluant des données de cold-start, de sorte que nous ne devrions pas traiter les deux processus d'entraînement comme interchangeables. Ce qui m'intéresse le plus à propos du Group Relative Policy Optimization, ou GRPO comme la plupart d'entre nous le savons, c'est à quel point le setup de base a besoin peu de feedback. Un modèle peut générer plusieurs tentatives à une question, recevoir une note pour chacune, et utiliser les différences pour ajuster son comportement.

Nous pouvons même vérifier la réponse finale sans écrire la solution que nous voulons qu'elle imite. Combiné avec des techniques qui réduisent la mémoire d'entraînement, cela rend les expériences de raisonnement plus petites plus accessibles. Cela laisse deux choses dignes d'être comprises avant de choisir un modèle ou une GPU : comment ces notes guident une mise à jour, et que se passe-t-il lorsque la règle de notation récompense la mauvaise chose.

Un exemple simple d'arithmétique aide à expliquer les deux. Considérons quatre réponses possibles à la même question et comment une fonction de récompense noterait chacune. Un problème avec une réponse que nous pouvons vérifier : Un magasin a 6 boîtes avec 8 articles chacune.

Il vend 6 articles. Combien d'articles restent-il ? La réponse est 42. Une expression Python peut la vérifier.

Maintenant, cette simple vérification nous donne quelque chose de précieux : un moyen indépendant de noter la réponse finale. Nous n'avons pas besoin d'un autre modèle de langage pour décider si la réponse semble convaincante. Dans un ensemble de données d'entraînement, la question va au modèle tandis que la réponse attendue reste avec le vérificateur.

Le modèle génère une réponse, le vérificateur la note, et l'algorithme d'entraînement utilise cette note pour ajuster le comportement du modèle. Facile. Nous pouvons donc utiliser des paires question-réponse sans fournir de solutions travaillées comme cibles d'entraînement supervisé.

C'est l'attrait de l'apprentissage par renforcement avec des récompenses vérifiables : les commentaires peuvent venir de la vérification d'un résultat. Pour un système d'inventaire réel, l'arithmétique ordinaire reste la solution sensée. Le modèle de langage serait une calculatrice chère avec des opinions.

Ici, l'exemple rend le mécanisme d'apprentissage facile à inspecter. Cela montre également où notre vérificateur échoue, car vérifier que l'entier final est correct ne nous dit pas si le raisonnement qui l'accompagne a du sens. GRPO a été introduit dans le travail Deep Seek Math comme alternative aux exigences mémoire de l'entraînement PPO conventionnel.

Les implémentations courantes de actor-critic PPO entraînent un estimateur de valeur, souvent appelé critic, aux côtés de la politique. Cet estimateur fournit une base pour juger le résultat d'une action. GRPO obtient sa baseline d'un groupe de réponses échantillonnées pour le même prompt.

Au lieu de demander à un critic séparé d'estimer à quel point le modèle devrait bien faire, il compare combien les tentatives réelles ont bien fonctionné. Imaginez que le modèle produit ces quatre réponses : Tentative Réponse finale Récompense de correction 1 42 1, 2 24 0, 3 42 1, 4 48 0. La récompense moyenne du groupe est 0,5.

Les tentatives 1 et 3 ont mieux performé que cette moyenne ; les tentatives 2 et 4 ont pire performé. La formulation originale de récompense basée sur les résultats standardise cette comparaison : [Ai=ri−rˉσr+ϵ]. Cela indique que les tentatives 1 et 3 ont des récompenses standardisées supérieures à 0, tandis que les tentatives 2 et 4 ont des récompenses standardisées inférieures à 0.

De cette façon, GRPO utilise la comparaison d'un groupe de réponses pour guider la mise à jour du modèle, sans avoir besoin de critic externe.