HeadlinesBriefing HeadlinesBriefing 12 languages

Fixing GRPO's credit assignment problem without evaluating every step

Hacker News ·

🇬🇧 English

Group Relative Policy Optimization (GRPO) has become a promising approach for training large language model agents. However, its uniform assignment of trajectory-level advantages to all policy tokens fails to distinguish consequential decisions from less relevant ones, obscuring which intermediate decisions contributed to success.

We introduce Pro Ver, a framework that targets potentially pivotal decisions for fine-grained credit assignment in agentic reinforcement learning. Given a rollout group, an agentic judge contrasts successful and failed trajectories to propose a segment potentially responsible for their divergent outcomes. Rather than directly trusting the judge's assessment, Pro Ver verifies the proposed segment by estimating its advantage from the difference in terminal success rates between current-policy continuations sampled before and after the segment.

Positive estimates are then incorporated into the GRPO advantages of policy tokens within the proposed segment. By using model judgment only to select where to verify, Pro Ver grounds local credit in observed outcomes without exhaustively evaluating every intermediate state. Across ALFWorld, Web Shop, and Search QA, Pro Ver achieves the strongest average performance at both model scales, with relative improvements over GRPO of 9.91% and 7.12% for Qwen3.5-2B and Qwen3.5-4B, respectively.

View original article →


🇸🇦 العربية

استهداف القرارات المحورية للائتمان في التعلم المعزز الوكيل

أصبح تحسين السياسة النسبي الجماعي (GRPO) نهجاً واعداً لتدريب وكلاء نموذج اللغة الكبير. ومع ذلك، فإن تعيينه الموحد للمزايا على مستوى المسار لجميع رموز السياسة يفشل في تمييز القرارات الحاسمة عن القرارات الأقل صلة، مما يخفي أي القرارات الوسيطة ساهمت في النجاح.

نقدم Pro Ver، وهو إطار يستهدف القرارات المحتملة المحورية لتخصيص الائتمان الدقيق في التعلم المعزز الوكيل. بالنظر إلى مجموعة التشغيل، يقارن حاكم وكيل المسارات الناجحة والفاشلة لاقتراح مقطع مسؤول محتملاً عن نتائجها المتباينة. بدلاً من الثقة المباشرة في تقييم الحاكم، يتحقق Pro Ver من المقطع المقترح من خلال تقدير مزاياه من الفرق في معدلات النجاح النهائية بين استمرارات السياسة الحالية المأخوذة قبل المقطع وبعده.

يتم بعد ذلك دمج التقديرات الإيجابية في مزايا GRPO لرموز السياسة داخل المقطع المقترح. باستخدام حكم النموذج فقط لاختيار مكان التحقق، يثبت Pro Ver الائتمان المحلي في النتائج الملاحظة دون تقييم شامل لكل حالة وسيطة. عبر ALFWorld وWeb Shop وSearch QA، يحقق Pro Ver أقوى متوسط أداء في كلا مقياسي النموذج، مع تحسينات نسبية على GRPO بنسبة 9.91% و7.12% لـ Qwen3.5-2B وQwen3.5-4B على التوالي.

الكيانات الرئيسية: الأشخاص: Dongwon Jung

سؤال شائع: ما هي المساهمة الرئيسية لـ Pro Ver؟

يستهدف Pro Ver ويثبت القرارات المحورية في التعلم المعزز الوكيل، مما يحسن تخصيص الائتمان دون تقييم شامل.

س شائع س: ما هي المساهمة الرئيسية لـ Pro Ver؟

س شائع ج: يستهدف Pro Ver ويثبت القرارات المحورية في التعلم المعزز الوكيل، مما يحسن تخصيص الائتمان دون تقييم شامل.

ما هي المساهمة الرئيسية لـ Pro Ver؟

يستهدف Pro Ver ويثبت القرارات المحورية في التعلم المعزز الوكيل، مما يحسن تخصيص الائتمان دون تقييم شامل.

العربية version →


🇧🇩 বাংলা

এজেন্টিক RL-এ ক্রেডিটের জন্য গুরুত্বপূর্ণ সিদ্ধান্ত লক্ষ্য করা

গ্রুপ রিলেটিভ পলিসি অপ্টিমাইজেশন (GRPO) বড় ভাষা মডেল এজেন্টদের প্রশিক্ষণের জন্য একটি প্রতিশ্রুতিশীল পদ্ধতি হয়ে উঠেছে। তবে, ট্র্যাজেক্টোরি-স্তরের সুবিধাগুলি সমস্ত পলিসি টোকেনে সমানভাবে বরাদ্দ করা গুরুত্বপূর্ণ সিদ্ধান্তগুলিকে কম প্রাসঙ্গিক সিদ্ধান্তগুলি থেকে আলাদা করতে ব্যর্থ হয়, যা অস্পষ্ট করে দেয় কোন মধ্যবর্তী সিদ্ধান্তগুলি সাফল্যে অবদান রাখে।

আমরা Pro Ver উপস্থাপন করছি, একটি কাঠামো যা এজেন্টিক রিইনফোর্সমেন্ট লার্নিং-এ সূক্ষ্ম ক্রেডিট বরাদ্দের জন্য সম্ভাব্য গুরুত্বপূর্ণ সিদ্ধান্তগুলিকে লক্ষ্য করে। একটি রোলআউট গ্রুপ দেওয়া হলে, একজন এজেন্টিক বিচারক সফল এবং ব্যর্থ ট্র্যাজেক্টোরি তুলনা করে একটি সেগমেন্ট প্রস্তাব করেন যা তাদের ভিন্ন ফলাফলের জন্য সম্ভাব্যভাবে দায়ী। বিচারকের মূল্যায়নের উপর সরাসরি আস্থা না রেখে, Pro Ver সেগমেন্টের আগে এবং পরে নমুনা নেওয়া বর্তমান পলিসির ধারাবাহিকতার টার্মিনাল সাফল্যের হারের পার্থক্য থেকে এর সুবিধা অনুমান করে প্রস্তাবিত সেগমেন্ট যাচাই করে।

ইতিবাচক অনুমানগুলি তারপর প্রস্তাবিত সেগমেন্টের মধ্যে পলিসি টোকেনের GRPO সুবিধাগুলিতে অন্তর্ভুক্ত করা হয়। শুধুমাত্র যেখানে যাচাই করতে হবে তা নির্বাচন করতে মডেল বিচার ব্যবহার করে, Pro Ver প্রতিটি মধ্যবর্তী অবস্থার ব্যাপক মূল্যায়ন ছাড়াই পর্যবেক্ষিত ফলাফলে স্থানীয় ক্রেডিট ভিত্তি করে। ALFWorld, Web Shop এবং Search QA জুড়ে, Pro Ver উভয় মডেল স্কেলে শক্তিশালী গড় কর্মক্ষমতা অর্জন করে, Qwen3.5-2B এবং Qwen3.5-4B-এর জন্য GRPO-এর তুলনায় আপেক্ষিক উন্নতি যথাক্রমে 9.91% এবং 7.12%।

মূল সত্তা: ব্যক্তি: Dongwon Jung

সচরাচর জিজ্ঞাসা: Pro Ver-এর প্রধান অবদান কী?

Pro Ver এজেন্টিক রিইনফোর্সমেন্ট লার্নিং-এ গুরুত্বপূর্ণ সিদ্ধান্তগুলি নির্বাচনীভাবে লক্ষ্য ও যাচাই করে, ব্যাপক মূল্যায়ন ছাড়াই ক্রেডিট বরাদ্দ উন্নত করে।

FAQ Q: Pro Ver-এর প্রধান অবদান কী?

FAQ A: Pro Ver এজেন্টিক রিইনফোর্সমেন্ট লার্নিং-এ গুরুত্বপূর্ণ সিদ্ধান্তগুলি নির্বাচনীভাবে লক্ষ্য ও যাচাই করে, ব্যাপক মূল্যায়ন ছাড়াই ক্রেডিট বরাদ্দ উন্নত করে।

Pro Ver-এর প্রধান অবদান কী?

Pro Ver এজেন্টিক রিইনফোর্সমেন্ট লার্নিং-এ গুরুত্বপূর্ণ সিদ্ধান্তগুলি নির্বাচনীভাবে লক্ষ্য ও যাচাই করে, ব্যাপক মূল্যায়ন ছাড়াই ক্রেডিট বরাদ্দ উন্নত করে।

বাংলা version →


🇩🇪 Deutsch

Fokussierung auf entscheidende Entscheidungen für Kredit in agentischem RL

Die Gruppenrelative Politikoptimierung (GRPO) ist zu einem vielversprechenden Ansatz zum Trainieren von großen Sprachmodell-Agenten geworden. Ihre gleichmäßige Zuweisung von Trajektorien-Vorteilen an alle Politik-Token unterscheidet jedoch nicht zwischen folgenreichen und weniger relevanten Entscheidungen und verschleiert, welche Zwischenentscheidungen zum Erfolg beigetragen haben.

Wir stellen Pro Ver vor, ein Framework, das potenziell entscheidende Entscheidungen für die feinkörnige Kreditzuweisung im agentischen Verstärkungslernen anvisiert. Bei einer gegebenen Rollout-Gruppe vergleicht ein agentischer Richter erfolgreiche und fehlgeschlagene Trajektorien, um ein Segment vorzuschlagen, das möglicherweise für ihre unterschiedlichen Ergebnisse verantwortlich ist. Anstatt der Bewertung des Richters direkt zu vertrauen, verifiziert Pro Ver das vorgeschlagene Segment, indem es seinen Vorteil aus der Differenz der terminalen Erfolgsraten zwischen vor und nach dem Segment abgetasteten Fortsetzungen der aktuellen Politik schätzt.

Positive Schätzungen werden dann in die GRPO-Vorteile der Politik-Token innerhalb des vorgeschlagenen Segments eingebaut. Indem Modellurteil nur verwendet wird, um auszuwählen, wo verifiziert werden soll, verankert Pro Ver lokalen Kredit in beobachteten Ergebnissen, ohne jeden Zwischenzustand erschöpfend zu bewerten. Auf ALFWorld, Web Shop und Search QA erzielt Pro Ver die stärkste durchschnittliche Leistung auf beiden Modellskalen mit relativen Verbesserungen gegenüber GRPO von 9,91 % und 7,12 % für Qwen3.5-2B bzw. Qwen3.5-4B.

Wichtige Entitäten: Personen: Dongwon Jung

Was ist der Hauptbeitrag von Pro Ver?

Pro Ver zielt selektiv auf entscheidende Entscheidungen im agentischen Verstärkungslernen ab und verbessert die Kreditzuweisung ohne erschöpfende Bewertung.

Deutsch version →


🇪🇸 Español

Dirigiendo Decisiones Pivotes para el Crédito en RL Agéntico

La Optimización de Política Relativa por Grupos (GRPO) se ha convertido en un enfoque prometedor para entrenar agentes de modelos de lenguaje grandes. Sin embargo, su asignación uniforme de ventajas a nivel de trayectoria a todos los tokens de política no distingue decisiones consecuentes de otras menos relevantes, oscureciendo qué decisiones intermedias contribuyeron al éxito.

Presentamos Pro Ver, un marco que se dirige a decisiones potencialmente pivotes para la asignación de crédito de grano fino en el aprendizaje por refuerzo agéntico. Dado un grupo de rollout, un juez agéntico contrasta trayectorias exitosas y fallidas para proponer un segmento potencialmente responsable de sus resultados divergentes. En lugar de confiar directamente en la evaluación del juez, Pro Ver verifica el segmento propuesto estimando su ventaja a partir de la diferencia en las tasas de éxito terminal entre continuaciones de la política actual muestreadas antes y después del segmento.

Las estimaciones positivas se incorporan luego en las ventajas GRPO de los tokens de política dentro del segmento propuesto. Al usar el juicio del modelo solo para seleccionar dónde verificar, Pro Ver fundamenta el crédito local en los resultados observados sin evaluar exhaustivamente cada estado intermedio. En ALFWorld, Web Shop y Search QA, Pro Ver logra el rendimiento promedio más fuerte en ambas escalas de modelo, con mejoras relativas sobre GRPO del 9.91% y 7.12% para Qwen3.5-2B y Qwen3.5-4B, respectivamente.

Entidades clave: Personas: Dongwon Jung

Pregunta frecuente: ¿Cuál es la principal contribución de Pro Ver?

Pro Ver se dirige y verifica decisiones pivotes en el aprendizaje por refuerzo agéntico, mejorando la asignación de crédito sin evaluación exhaustiva.

Pregunta Frecuente Q: ¿Cuál es la principal contribución de Pro Ver?

Pregunta Frecuente A: Pro Ver se dirige y verifica decisiones pivotes en el aprendizaje por refuerzo agéntico, mejorando la asignación de crédito sin evaluación exhaustiva.

¿Cuál es la principal contribución de Pro Ver?

Pro Ver se dirige y verifica decisiones pivotes en el aprendizaje por refuerzo agéntico, mejorando la asignación de crédito sin evaluación exhaustiva.

Español version →


🇫🇷 Français

Cibler les décisions clés pour le crédit dans l'RL agentique

L'optimisation relative de politique par groupes (GRPO) est devenue une approche prometteuse pour former des agents de grands modèles de langage. Cependant, son attribution uniforme des avantages au niveau de la trajectoire à tous les jetons de politique ne parvient pas à distinguer les décisions conséquentes des décisions moins pertinentes, obscurcissant quelles décisions intermédiaires ont contribué au succès.

Nous présentons Pro Ver, un framework qui cible les décisions potentiellement clés pour une attribution fine du crédit dans l'apprentissage par renforcement agentique. Étant donné un groupe de déploiement, un juge agentique contraste les trajectoires réussies et échouées pour proposer un segment potentiellement responsable de leurs résultats divergents. Plutôt que de se fier directement à l'évaluation du juge, Pro Ver vérifie le segment proposé en estimant son avantage à partir de la différence des taux de réussite finaux entre les continuations de la politique actuelle échantillonnées avant et après le segment.

Les estimations positives sont ensuite incorporées dans les avantages GRPO des jetons de politique dans le segment proposé. En utilisant le jugement du modèle uniquement pour sélectionner où vérifier, Pro Ver ancre le crédit local dans les résultats observés sans évaluer exhaustivement chaque état intermédiaire. Sur ALFWorld, Web Shop et Search QA, Pro Ver obtient la meilleure performance moyenne aux deux échelles de modèle, avec des améliorations relatives par rapport à GRPO de 9,91 % et 7,12 % pour Qwen3.5-2B et Qwen3.5-4B, respectivement.

Entités clés : Personnes : Dongwon Jung

FAQ : Quelle est la principale contribution de Pro Ver ?

Pro Ver cible et vérifie sélectivement les décisions clés dans l'apprentissage par renforcement agentique, améliorant l'attribution du crédit sans évaluation exhaustive.

FAQ Q : Quelle est la principale contribution de Pro Ver ?

FAQ A : Pro Ver cible et vérifie sélectivement les décisions clés dans l'apprentissage par renforcement agentique, améliorant l'attribution du crédit sans évaluation exhaustive.

Quelle est la principale contribution de Pro Ver ?

Pro Ver cible et vérifie sélectivement les décisions clés dans l'apprentissage par renforcement agentique, améliorant l'attribution du crédit sans évaluation exhaustive.

Français version →


🇮🇳 हिन्दी

एजेंटिक आरएल में क्रेडिट के लिए महत्वपूर्ण निर्णयों को लक्षित करना

ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) बड़े भाषा मॉडल एजेंटों को प्रशिक्षित करने के लिए एक आशाजनक दृष्टिकोण बन गया है। हालांकि, सभी पॉलिसी टोकनों को ट्रैजेक्टरी-स्तरीय लाभों का एकसमान असाइनमेंट, महत्वपूर्ण निर्णयों को कम प्रासंगिक निर्णयों से अलग करने में विफल रहता है, जिससे यह अस्पष्ट हो जाता है कि कौन से मध्यवर्ती निर्णय सफलता में योगदान करते हैं।

हम Pro Ver प्रस्तुत करते हैं, एक ढांचा जो एजेंटिक रीइन्फोर्समेंट लर्निंग में बारीक क्रेडिट असाइनमेंट के लिए संभावित महत्वपूर्ण निर्णयों को लक्षित करता है। दिए गए रोलआउट समूह में, एक एजेंटिक जज सफल और असफल ट्रैजेक्टरी की तुलना करके एक ऐसा सेगमेंट प्रस्तावित करता है जो उनके भिन्न परिणामों के लिए संभावित रूप से जिम्मेदार हो। जज के आकलन पर सीधे भरोसा करने के बजाय, Pro Ver सेगमेंट से पहले और बाद में नमूने लिए गए वर्तमान पॉलिसी निरंतरता के टर्मिनल सफलता दरों में अंतर से इसके लाभ का अनुमान लगाकर प्रस्तावित सेगमेंट को सत्यापित करता है।

सकारात्मक अनुमानों को फिर प्रस्तावित सेगमेंट के भीतर पॉलिसी टोकन के GRPO लाभों में शामिल किया जाता है। मॉडल निर्णय का उपयोग केवल यह चुनने के लिए करके कि कहाँ सत्यापित करना है, Pro Ver स्थानीय क्रेडिट को देखे गए परिणामों में आधारित करता है बिना प्रत्येक मध्यवर्ती स्थिति का व्यापक मूल्यांकन किए। ALFWorld, Web Shop और Search QA पर, Pro Ver दोनों मॉडल पैमानों पर सबसे मजबूत औसत प्रदर्शन प्राप्त करता है, Qwen3.5-2B और Qwen3.5-4B के लिए GRPO पर सापेक्ष सुधार क्रमशः 9.91% और 7.12% है।

प्रमुख संस्थाएं: लोग: Dongwon Jung

सामान्य प्रश्न: Pro Ver का मुख्य योगदान क्या है?

Pro Ver एजेंटिक रीइन्फोर्समेंट लर्निंग में महत्वपूर्ण निर्णयों को चुनिंदा रूप से लक्षित और सत्यापित करता है, व्यापक मूल्यांकन के बिना क्रेडिट असाइनमेंट में सुधार करता है।

FAQ Q: Pro Ver का मुख्य योगदान क्या है?

FAQ A: Pro Ver एजेंटिक रीइन्फोर्समेंट लर्निंग में महत्वपूर्ण निर्णयों को चुनिंदा रूप से लक्षित और सत्यापित करता है, व्यापक मूल्यांकन के बिना क्रेडिट असाइनमेंट में सुधार करता है।

Pro Ver का मुख्य योगदान क्या है?

Pro Ver एजेंटिक रीइन्फोर्समेंट लर्निंग में महत्वपूर्ण निर्णयों को चुनिंदा रूप से लक्षित और सत्यापित करता है, व्यापक मूल्यांकन के बिना क्रेडिट असाइनमेंट में सुधार करता है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Menargetkan Keputusan Penting untuk Kredit dalam RL Agen

Optimasi Kebijakan Relatif Grup (GRPO) telah menjadi pendekatan yang menjanjikan untuk melatih agen model bahasa besar. Namun, pemberian keuntungan tingkat trajektori secara seragam ke semua token kebijakan gagal membedakan keputusan yang penting dari yang kurang relevan, mengaburkan keputusan antara mana yang berkontribusi pada kesuksesan.

Kami memperkenalkan Pro Ver, sebuah kerangka kerja yang menargetkan keputusan yang berpotensi penting untuk penugasan kredit yang terperinci dalam pembelajaran penguatan agen. Diberikan grup peluncuran, seorang hakim agen membandingkan trajektori yang berhasil dan gagal untuk mengusulkan segmen yang berpotensi bertanggung jawab atas hasil yang berbeda. Alih-alih langsung mempercayai penilaian hakim, Pro Ver memverifikasi segmen yang diusulkan dengan memperkirakan keuntungannya dari perbedaan dalam tingkat keberhasilan terminal antara kelanjutan kebijakan saat ini yang diambil sampel sebelum dan sesudah segmen.

Perkiraan positif kemudian dimasukkan ke dalam keuntungan GRPO dari token kebijakan dalam segmen yang diusulkan. Dengan menggunakan penilaian model hanya untuk memilih tempat memverifikasi, Pro Ver mendasarkan kredit lokal pada hasil yang diamati tanpa mengevaluasi secara menyeluruh setiap keadaan antara. Di ALFWorld, Web Shop, dan Search QA, Pro Ver mencapai kinerja rata-rata terkuat pada kedua skala model, dengan peningkatan relatif terhadap GRPO sebesar 9,91% dan 7,12% untuk Qwen3.5-2B dan Qwen3.5-4B, masing-masing.

Entitas Kunci: Orang: Dongwon Jung

Apa kontribusi utama Pro Ver?

Pro Ver secara selektif menargetkan dan memverifikasi keputusan penting dalam pembelajaran penguatan agen, meningkatkan penugasan kredit tanpa evaluasi yang menyeluruh.

Bahasa Indonesia version →


🇯🇵 日本語

エージェントRLにおけるクレジットのための重要な決定のターゲット設定

グループ相対ポリシー最適化(GRPO)は、大規模言語モデルエージェントを訓練するための有望なアプローチになっています。しかし、軌跡レベルのアドバンテージをすべてのポリシートークンに均一に割り当てる方法は、重要な決定とそれほど重要でない決定を区別できず、どの中間決定が成功に貢献したかを不明瞭にします。

我々はPro Verを提案します。これはエージェント強化学習において、きめ細かいクレジット割り当てのために潜在的に重要な決定をターゲットにするフレームワークです。ロールアウトグループが与えられると、エージェント評価者は成功した軌跡と失敗した軌跡を比較し、それらの異なる結果の原因となる可能性のあるセグメントを提案します。評価者の判断を直接信頼するのではなく、Pro Verは提案されたセグメントの前後にサンプリングされた現在のポリシーの継続の最終成功率の差からそのアドバンテージを推定することで、提案されたセグメントを検証します。

正の推定値はその後、提案されたセグメント内のポリシートークンのGRPOアドバンテージに組み込まれます。モデルの判断を検証する場所を選択するためだけに使用することにより、Pro Verはすべての中間状態を網羅的に評価することなく、観察された結果にローカルクレジットを基づけます。ALFWorld、Web Shop、Search QAにおいて、Pro Verは両方のモデルスケールで最強の平均パフォーマンスを達成し、Qwen3.5-2BとQwen3.5-4BでGRPOに対する相対的な改善はそれぞれ9.91%と7.12%です。

主要エンティティ:人物:Dongwon Jung

FAQ:Pro Verの主な貢献は何ですか?

Pro Verはエージェント強化学習において重要な決定を選択的にターゲットにして検証し、網羅的な評価なしにクレジット割り当てを改善します。

FAQ Q:Pro Verの主な貢献は何ですか?

FAQ A:Pro Verはエージェント強化学習において重要な決定を選択的にターゲットにして検証し、網羅的な評価なしにクレジット割り当てを改善します。

Pro Verの主な貢献は何ですか?

Pro Verはエージェント強化学習において重要な決定を選択的にターゲットにして検証し、網羅的な評価なしにクレジット割り当てを改善します。

日本語 version →


🇧🇷 Português

Mirando Decisões Fundamentais para Crédito em RL Agentivo

A Otimização Relativa de Política por Grupos (GRPO) tornou-se uma abordagem promissora para treinar agentes de modelos de linguagem grandes. No entanto, sua atribuição uniforme de vantagens no nível de trajetória a todos os tokens de política falha em distinguir decisões consequentes das menos relevantes, obscurecendo quais decisões intermediárias contribuíram para o sucesso.

Apresentamos Pro Ver, um framework que mira decisões potencialmente fundamentais para atribuição de crédito de granulação fina em aprendizado por reforço agentivo. Dado um grupo de rollout, um juiz agentivo contrasta trajetórias bem-sucedidas e falhas para propor um segmento potencialmente responsável por seus resultados divergentes. Em vez de confiar diretamente na avaliação do juiz, Pro Ver verifica o segmento proposto estimando sua vantagem a partir da diferença nas taxas de sucesso terminal entre continuações da política atual amostradas antes e depois do segmento.

Estimativas positivas são então incorporadas às vantagens GRPO dos tokens de política dentro do segmento proposto. Ao usar o julgamento do modelo apenas para selecionar onde verificar, Pro Ver fundamenta o crédito local nos resultados observados sem avaliar exaustivamente cada estado intermediário. Em ALFWorld, Web Shop e Search QA, Pro Ver alcança o desempenho médio mais forte em ambas as escalas de modelo, com melhorias relativas sobre GRPO de 9,91% e 7,12% para Qwen3.5-2B e Qwen3.5-4B, respectivamente.

Entidades-chave: Pessoas: Dongwon Jung

Qual é a principal contribuição do Pro Ver?

Pro Ver mira e verifica seletivamente decisões fundamentais no aprendizado por reforço agentivo, melhorando a atribuição de crédito sem avaliação exaustiva.

Português version →


🇷🇺 Русский

Нацеливание на ключевые решения для кредита в агентном RL

Групповая относительная оптимизация политики (GRPO) стала перспективным подходом для обучения агентов больших языковых моделей. Однако её равномерное присвоение преимуществ на уровне траектории всем токенам политики не позволяет различать важные решения и менее значимые, скрывая, какие промежуточные решения способствовали успеху.

Мы представляем Pro Ver, фреймворк, который нацеливается на потенциально ключевые решения для точного распределения кредита в агентном обучении с подкреплением. Для данной группы развёртывания агентный судья сравнивает успешные и неудачные траектории, предлагая сегмент, потенциально ответственный за их расходящиеся результаты. Вместо того чтобы напрямую доверять оценке судьи, Pro Ver проверяет предложенный сегмент, оценивая его преимущество по разнице в конечных показателях успеха между продолжениями текущей политики, выбранными до и после сегмента.

Положительные оценки затем включаются в преимущества GRPO для токенов политики в пределах предложенного сегмента. Используя суждение модели только для выбора места проверки, Pro Ver обосновывает локальный кредит на наблюдаемых результатах без исчерпывающей оценки каждого промежуточного состояния. На ALFWorld, Web Shop и Search QA Pro Ver достигает наилучшей средней производительности на обоих масштабах моделей с относительными улучшениями по сравнению с GRPO на 9,91% и 7,12% для Qwen3.5-2B и Qwen3.5-4B соответственно.

Ключевые сущности: Люди: Dongwon Jung

Часто задаваемый вопрос: В чём основной вклад Pro Ver?

Pro Ver выборочно нацеливается и проверяет ключевые решения в агентном обучении с подкреплением, улучшая распределение кредита без исчерпывающей оценки.

ЧЗВ В: В чём основной вклад Pro Ver?

ЧЗВ О: Pro Ver выборочно нацеливается и проверяет ключевые решения в агентном обучении с подкреплением, улучшая распределение кредита без исчерпывающей оценки.

В чём основной вклад Pro Ver?

Pro Ver выборочно нацеливается и проверяет ключевые решения в агентном обучении с подкреплением, улучшая распределение кредита без исчерпывающей оценки.

Русский version →


🇨🇳 简体中文

在基于智能体的强化学习中针对关键决策进行信用分配

组相对策略优化(GRPO)已成为一种有前景的大型语言模型智能体训练方法。然而,它将轨迹级优势统一分配给所有策略标记,未能区分关键决策与次要决策,模糊了哪些中间决策促成了成功。

我们提出了 Pro Ver,一个在智能体强化学习中针对潜在关键决策进行细粒度信用分配的框架。给定一个rollout组,一个智能体评判者对比成功和失败的轨迹,提出一个可能造成结果差异的段。Pro Ver 不完全依赖评判者的评估,而是通过估计该段的优势来验证它——该优势通过比较在该段前后采样的当前策略延续的终端成功率差异得出。

正估计随后被纳入所提议段内策略标记的 GRPO 优势。通过仅使用模型评判来选择验证位置,Pro Ver 将局部信用基于观察到的结果,无需详尽评估每个中间状态。在 ALFWorld、Web Shop 和 Search QA 上,Pro Ver 在两个模型规模上均实现最强平均性能,在 Qwen3.5-2B 和 Qwen3.5-4B 上分别相对 GRPO 提升 9.91% 和 7.12%。

关键实体:人物:Dongwon Jung

FAQ:Pro Ver 的主要贡献是什么?

Pro Ver 选择性靶向并验证智能体强化学习中的关键决策,无需详尽评估即可改善信用分配。

FAQ Q:Pro Ver 的主要贡献是什么?

FAQ A:Pro Ver 选择性靶向并验证智能体强化学习中的关键决策,无需详尽评估即可改善信用分配。

Pro Ver 的主要贡献是什么?

Pro Ver 选择性靶向并验证智能体强化学习中的关键决策,无需详尽评估即可改善信用分配。

简体中文 version →