গ্রুপ রিলেটিভ পলিসি অপ্টিমাইজেশন (GRPO) বড় ভাষা মডেল এজেন্টদের প্রশিক্ষণের জন্য একটি প্রতিশ্রুতিশীল পদ্ধতি হয়ে উঠেছে। তবে, ট্র্যাজেক্টোরি-স্তরের সুবিধাগুলি সমস্ত পলিসি টোকেনে সমানভাবে বরাদ্দ করা গুরুত্বপূর্ণ সিদ্ধান্তগুলিকে কম প্রাসঙ্গিক সিদ্ধান্তগুলি থেকে আলাদা করতে ব্যর্থ হয়, যা অস্পষ্ট করে দেয় কোন মধ্যবর্তী সিদ্ধান্তগুলি সাফল্যে অবদান রাখে।
আমরা Pro Ver উপস্থাপন করছি, একটি কাঠামো যা এজেন্টিক রিইনফোর্সমেন্ট লার্নিং-এ সূক্ষ্ম ক্রেডিট বরাদ্দের জন্য সম্ভাব্য গুরুত্বপূর্ণ সিদ্ধান্তগুলিকে লক্ষ্য করে। একটি রোলআউট গ্রুপ দেওয়া হলে, একজন এজেন্টিক বিচারক সফল এবং ব্যর্থ ট্র্যাজেক্টোরি তুলনা করে একটি সেগমেন্ট প্রস্তাব করেন যা তাদের ভিন্ন ফলাফলের জন্য সম্ভাব্যভাবে দায়ী। বিচারকের মূল্যায়নের উপর সরাসরি আস্থা না রেখে, Pro Ver সেগমেন্টের আগে এবং পরে নমুনা নেওয়া বর্তমান পলিসির ধারাবাহিকতার টার্মিনাল সাফল্যের হারের পার্থক্য থেকে এর সুবিধা অনুমান করে প্রস্তাবিত সেগমেন্ট যাচাই করে।
ইতিবাচক অনুমানগুলি তারপর প্রস্তাবিত সেগমেন্টের মধ্যে পলিসি টোকেনের GRPO সুবিধাগুলিতে অন্তর্ভুক্ত করা হয়। শুধুমাত্র যেখানে যাচাই করতে হবে তা নির্বাচন করতে মডেল বিচার ব্যবহার করে, Pro Ver প্রতিটি মধ্যবর্তী অবস্থার ব্যাপক মূল্যায়ন ছাড়াই পর্যবেক্ষিত ফলাফলে স্থানীয় ক্রেডিট ভিত্তি করে। ALFWorld, Web Shop এবং Search QA জুড়ে, Pro Ver উভয় মডেল স্কেলে শক্তিশালী গড় কর্মক্ষমতা অর্জন করে, Qwen3.5-2B এবং Qwen3.5-4B-এর জন্য GRPO-এর তুলনায় আপেক্ষিক উন্নতি যথাক্রমে 9.91% এবং 7.12%।
মূল সত্তা: ব্যক্তি: Dongwon Jung
সচরাচর জিজ্ঞাসা: Pro Ver-এর প্রধান অবদান কী?
Pro Ver এজেন্টিক রিইনফোর্সমেন্ট লার্নিং-এ গুরুত্বপূর্ণ সিদ্ধান্তগুলি নির্বাচনীভাবে লক্ষ্য ও যাচাই করে, ব্যাপক মূল্যায়ন ছাড়াই ক্রেডিট বরাদ্দ উন্নত করে।
FAQ Q: Pro Ver-এর প্রধান অবদান কী?
FAQ A: Pro Ver এজেন্টিক রিইনফোর্সমেন্ট লার্নিং-এ গুরুত্বপূর্ণ সিদ্ধান্তগুলি নির্বাচনীভাবে লক্ষ্য ও যাচাই করে, ব্যাপক মূল্যায়ন ছাড়াই ক্রেডিট বরাদ্দ উন্নত করে।
উৎস: Hacker News · সারাংশ: HeadlinesBriefing