ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) बड़े भाषा मॉडल एजेंटों को प्रशिक्षित करने के लिए एक आशाजनक दृष्टिकोण बन गया है। हालांकि, सभी पॉलिसी टोकनों को ट्रैजेक्टरी-स्तरीय लाभों का एकसमान असाइनमेंट, महत्वपूर्ण निर्णयों को कम प्रासंगिक निर्णयों से अलग करने में विफल रहता है, जिससे यह अस्पष्ट हो जाता है कि कौन से मध्यवर्ती निर्णय सफलता में योगदान करते हैं।
हम Pro Ver प्रस्तुत करते हैं, एक ढांचा जो एजेंटिक रीइन्फोर्समेंट लर्निंग में बारीक क्रेडिट असाइनमेंट के लिए संभावित महत्वपूर्ण निर्णयों को लक्षित करता है। दिए गए रोलआउट समूह में, एक एजेंटिक जज सफल और असफल ट्रैजेक्टरी की तुलना करके एक ऐसा सेगमेंट प्रस्तावित करता है जो उनके भिन्न परिणामों के लिए संभावित रूप से जिम्मेदार हो। जज के आकलन पर सीधे भरोसा करने के बजाय, Pro Ver सेगमेंट से पहले और बाद में नमूने लिए गए वर्तमान पॉलिसी निरंतरता के टर्मिनल सफलता दरों में अंतर से इसके लाभ का अनुमान लगाकर प्रस्तावित सेगमेंट को सत्यापित करता है।
सकारात्मक अनुमानों को फिर प्रस्तावित सेगमेंट के भीतर पॉलिसी टोकन के GRPO लाभों में शामिल किया जाता है। मॉडल निर्णय का उपयोग केवल यह चुनने के लिए करके कि कहाँ सत्यापित करना है, Pro Ver स्थानीय क्रेडिट को देखे गए परिणामों में आधारित करता है बिना प्रत्येक मध्यवर्ती स्थिति का व्यापक मूल्यांकन किए। ALFWorld, Web Shop और Search QA पर, Pro Ver दोनों मॉडल पैमानों पर सबसे मजबूत औसत प्रदर्शन प्राप्त करता है, Qwen3.5-2B और Qwen3.5-4B के लिए GRPO पर सापेक्ष सुधार क्रमशः 9.91% और 7.12% है।
प्रमुख संस्थाएं: लोग: Dongwon Jung
सामान्य प्रश्न: Pro Ver का मुख्य योगदान क्या है?
Pro Ver एजेंटिक रीइन्फोर्समेंट लर्निंग में महत्वपूर्ण निर्णयों को चुनिंदा रूप से लक्षित और सत्यापित करता है, व्यापक मूल्यांकन के बिना क्रेडिट असाइनमेंट में सुधार करता है।
FAQ Q: Pro Ver का मुख्य योगदान क्या है?
FAQ A: Pro Ver एजेंटिक रीइन्फोर्समेंट लर्निंग में महत्वपूर्ण निर्णयों को चुनिंदा रूप से लक्षित और सत्यापित करता है, व्यापक मूल्यांकन के बिना क्रेडिट असाइनमेंट में सुधार करता है।
स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित