A Otimização Relativa de Política por Grupos (GRPO) tornou-se uma abordagem promissora para treinar agentes de modelos de linguagem grandes. No entanto, sua atribuição uniforme de vantagens no nível de trajetória a todos os tokens de política falha em distinguir decisões consequentes das menos relevantes, obscurecendo quais decisões intermediárias contribuíram para o sucesso.
Apresentamos Pro Ver, um framework que mira decisões potencialmente fundamentais para atribuição de crédito de granulação fina em aprendizado por reforço agentivo. Dado um grupo de rollout, um juiz agentivo contrasta trajetórias bem-sucedidas e falhas para propor um segmento potencialmente responsável por seus resultados divergentes. Em vez de confiar diretamente na avaliação do juiz, Pro Ver verifica o segmento proposto estimando sua vantagem a partir da diferença nas taxas de sucesso terminal entre continuações da política atual amostradas antes e depois do segmento.
Estimativas positivas são então incorporadas às vantagens GRPO dos tokens de política dentro do segmento proposto. Ao usar o julgamento do modelo apenas para selecionar onde verificar, Pro Ver fundamenta o crédito local nos resultados observados sem avaliar exaustivamente cada estado intermediário. Em ALFWorld, Web Shop e Search QA, Pro Ver alcança o desempenho médio mais forte em ambas as escalas de modelo, com melhorias relativas sobre GRPO de 9,91% e 7,12% para Qwen3.5-2B e Qwen3.5-4B, respectivamente.
Entidades-chave: Pessoas: Dongwon Jung
Fonte: Hacker News · Resumido por HeadlinesBriefing