HeadlinesBriefing HeadlinesBriefing.com

Pro Ver: Crédito Fino en RL Agéntico Dirigiendo Decisiones Clave

Hacker News •
×

La Optimización de Política Relativa por Grupos (GRPO) se ha convertido en un enfoque prometedor para entrenar agentes de modelos de lenguaje grandes. Sin embargo, su asignación uniforme de ventajas a nivel de trayectoria a todos los tokens de política no distingue decisiones consecuentes de otras menos relevantes, oscureciendo qué decisiones intermedias contribuyeron al éxito.

Presentamos Pro Ver, un marco que se dirige a decisiones potencialmente pivotes para la asignación de crédito de grano fino en el aprendizaje por refuerzo agéntico. Dado un grupo de rollout, un juez agéntico contrasta trayectorias exitosas y fallidas para proponer un segmento potencialmente responsable de sus resultados divergentes. En lugar de confiar directamente en la evaluación del juez, Pro Ver verifica el segmento propuesto estimando su ventaja a partir de la diferencia en las tasas de éxito terminal entre continuaciones de la política actual muestreadas antes y después del segmento.

Las estimaciones positivas se incorporan luego en las ventajas GRPO de los tokens de política dentro del segmento propuesto. Al usar el juicio del modelo solo para seleccionar dónde verificar, Pro Ver fundamenta el crédito local en los resultados observados sin evaluar exhaustivamente cada estado intermedio. En ALFWorld, Web Shop y Search QA, Pro Ver logra el rendimiento promedio más fuerte en ambas escalas de modelo, con mejoras relativas sobre GRPO del 9.91% y 7.12% para Qwen3.5-2B y Qwen3.5-4B, respectivamente.

Entidades clave: Personas: Dongwon Jung

Pregunta frecuente: ¿Cuál es la principal contribución de Pro Ver?

Pro Ver se dirige y verifica decisiones pivotes en el aprendizaje por refuerzo agéntico, mejorando la asignación de crédito sin evaluación exhaustiva.

Pregunta Frecuente Q: ¿Cuál es la principal contribución de Pro Ver?

Pregunta Frecuente A: Pro Ver se dirige y verifica decisiones pivotes en el aprendizaje por refuerzo agéntico, mejorando la asignación de crédito sin evaluación exhaustiva.

Fuente: Hacker News · Resumido por HeadlinesBriefing