HeadlinesBriefing HeadlinesBriefing.com

Pro Ver: エージェントRLでのきめ細かいクレジット割り当てのための重要な決定

Hacker News •
×

グループ相対ポリシー最適化(GRPO)は、大規模言語モデルエージェントを訓練するための有望なアプローチになっています。しかし、軌跡レベルのアドバンテージをすべてのポリシートークンに均一に割り当てる方法は、重要な決定とそれほど重要でない決定を区別できず、どの中間決定が成功に貢献したかを不明瞭にします。

我々はPro Verを提案します。これはエージェント強化学習において、きめ細かいクレジット割り当てのために潜在的に重要な決定をターゲットにするフレームワークです。ロールアウトグループが与えられると、エージェント評価者は成功した軌跡と失敗した軌跡を比較し、それらの異なる結果の原因となる可能性のあるセグメントを提案します。評価者の判断を直接信頼するのではなく、Pro Verは提案されたセグメントの前後にサンプリングされた現在のポリシーの継続の最終成功率の差からそのアドバンテージを推定することで、提案されたセグメントを検証します。

正の推定値はその後、提案されたセグメント内のポリシートークンのGRPOアドバンテージに組み込まれます。モデルの判断を検証する場所を選択するためだけに使用することにより、Pro Verはすべての中間状態を網羅的に評価することなく、観察された結果にローカルクレジットを基づけます。ALFWorld、Web Shop、Search QAにおいて、Pro Verは両方のモデルスケールで最強の平均パフォーマンスを達成し、Qwen3.5-2BとQwen3.5-4BでGRPOに対する相対的な改善はそれぞれ9.91%と7.12%です。

主要エンティティ:人物:Dongwon Jung

FAQ:Pro Verの主な貢献は何ですか?

Pro Verはエージェント強化学習において重要な決定を選択的にターゲットにして検証し、網羅的な評価なしにクレジット割り当てを改善します。

FAQ Q:Pro Verの主な貢献は何ですか?

FAQ A:Pro Verはエージェント強化学習において重要な決定を選択的にターゲットにして検証し、網羅的な評価なしにクレジット割り当てを改善します。

出典: Hacker News · 要約:HeadlinesBriefing