组相对策略优化(GRPO)已成为一种有前景的大型语言模型智能体训练方法。然而,它将轨迹级优势统一分配给所有策略标记,未能区分关键决策与次要决策,模糊了哪些中间决策促成了成功。
我们提出了 Pro Ver,一个在智能体强化学习中针对潜在关键决策进行细粒度信用分配的框架。给定一个rollout组,一个智能体评判者对比成功和失败的轨迹,提出一个可能造成结果差异的段。Pro Ver 不完全依赖评判者的评估,而是通过估计该段的优势来验证它——该优势通过比较在该段前后采样的当前策略延续的终端成功率差异得出。
正估计随后被纳入所提议段内策略标记的 GRPO 优势。通过仅使用模型评判来选择验证位置,Pro Ver 将局部信用基于观察到的结果,无需详尽评估每个中间状态。在 ALFWorld、Web Shop 和 Search QA 上,Pro Ver 在两个模型规模上均实现最强平均性能,在 Qwen3.5-2B 和 Qwen3.5-4B 上分别相对 GRPO 提升 9.91% 和 7.12%。
关键实体:人物:Dongwon Jung
FAQ:Pro Ver 的主要贡献是什么?
Pro Ver 选择性靶向并验证智能体强化学习中的关键决策,无需详尽评估即可改善信用分配。
FAQ Q:Pro Ver 的主要贡献是什么?
FAQ A:Pro Ver 选择性靶向并验证智能体强化学习中的关键决策,无需详尽评估即可改善信用分配。
来源: Hacker News · 由HeadlinesBriefing整理摘要