أصبح تحسين السياسة النسبي الجماعي (GRPO) نهجاً واعداً لتدريب وكلاء نموذج اللغة الكبير. ومع ذلك، فإن تعيينه الموحد للمزايا على مستوى المسار لجميع رموز السياسة يفشل في تمييز القرارات الحاسمة عن القرارات الأقل صلة، مما يخفي أي القرارات الوسيطة ساهمت في النجاح.
نقدم Pro Ver، وهو إطار يستهدف القرارات المحتملة المحورية لتخصيص الائتمان الدقيق في التعلم المعزز الوكيل. بالنظر إلى مجموعة التشغيل، يقارن حاكم وكيل المسارات الناجحة والفاشلة لاقتراح مقطع مسؤول محتملاً عن نتائجها المتباينة. بدلاً من الثقة المباشرة في تقييم الحاكم، يتحقق Pro Ver من المقطع المقترح من خلال تقدير مزاياه من الفرق في معدلات النجاح النهائية بين استمرارات السياسة الحالية المأخوذة قبل المقطع وبعده.
يتم بعد ذلك دمج التقديرات الإيجابية في مزايا GRPO لرموز السياسة داخل المقطع المقترح. باستخدام حكم النموذج فقط لاختيار مكان التحقق، يثبت Pro Ver الائتمان المحلي في النتائج الملاحظة دون تقييم شامل لكل حالة وسيطة. عبر ALFWorld وWeb Shop وSearch QA، يحقق Pro Ver أقوى متوسط أداء في كلا مقياسي النموذج، مع تحسينات نسبية على GRPO بنسبة 9.91% و7.12% لـ Qwen3.5-2B وQwen3.5-4B على التوالي.
الكيانات الرئيسية: الأشخاص: Dongwon Jung
سؤال شائع: ما هي المساهمة الرئيسية لـ Pro Ver؟
يستهدف Pro Ver ويثبت القرارات المحورية في التعلم المعزز الوكيل، مما يحسن تخصيص الائتمان دون تقييم شامل.
س شائع س: ما هي المساهمة الرئيسية لـ Pro Ver؟
س شائع ج: يستهدف Pro Ver ويثبت القرارات المحورية في التعلم المعزز الوكيل، مما يحسن تخصيص الائتمان دون تقييم شامل.
المصدر: Hacker News · لخّصه HeadlinesBriefing