L'optimisation relative de politique par groupes (GRPO) est devenue une approche prometteuse pour former des agents de grands modèles de langage. Cependant, son attribution uniforme des avantages au niveau de la trajectoire à tous les jetons de politique ne parvient pas à distinguer les décisions conséquentes des décisions moins pertinentes, obscurcissant quelles décisions intermédiaires ont contribué au succès.
Nous présentons Pro Ver, un framework qui cible les décisions potentiellement clés pour une attribution fine du crédit dans l'apprentissage par renforcement agentique. Étant donné un groupe de déploiement, un juge agentique contraste les trajectoires réussies et échouées pour proposer un segment potentiellement responsable de leurs résultats divergents. Plutôt que de se fier directement à l'évaluation du juge, Pro Ver vérifie le segment proposé en estimant son avantage à partir de la différence des taux de réussite finaux entre les continuations de la politique actuelle échantillonnées avant et après le segment.
Les estimations positives sont ensuite incorporées dans les avantages GRPO des jetons de politique dans le segment proposé. En utilisant le jugement du modèle uniquement pour sélectionner où vérifier, Pro Ver ancre le crédit local dans les résultats observés sans évaluer exhaustivement chaque état intermédiaire. Sur ALFWorld, Web Shop et Search QA, Pro Ver obtient la meilleure performance moyenne aux deux échelles de modèle, avec des améliorations relatives par rapport à GRPO de 9,91 % et 7,12 % pour Qwen3.5-2B et Qwen3.5-4B, respectivement.
Entités clés : Personnes : Dongwon Jung
FAQ : Quelle est la principale contribution de Pro Ver ?
Pro Ver cible et vérifie sélectivement les décisions clés dans l'apprentissage par renforcement agentique, améliorant l'attribution du crédit sans évaluation exhaustive.
FAQ Q : Quelle est la principale contribution de Pro Ver ?
FAQ A : Pro Ver cible et vérifie sélectivement les décisions clés dans l'apprentissage par renforcement agentique, améliorant l'attribution du crédit sans évaluation exhaustive.
Source: Hacker News · Résumé par HeadlinesBriefing