HeadlinesBriefing favicon HeadlinesBriefing.com

बाइटडांस त्सिंगहुआ DAPO RL सिस्टम

Hacker News •
×

बाइटडांस सीड और त्सिंगहुआ AIR ने DAPO जारी किया है, जो बड़े पैमाने के LLM के लिए एक ओपन-सोर्स रीइन्फोर्समेंट लर्निंग सिस्टम है। यह सिस्टम Qwen2.5-32B का उपयोग करके AIME 2024 पर 50+ अंक प्राप्त करता है, और कम प्रशिक्षण चरणों के साथ पिछली विधियों से बेहतर प्रदर्शन करता है। DAPO डिकपल्ड क्लिप और डायनामिक सैंपलिंग पॉलिसी ऑप्टिमाइज़ेशन पेश करता है। इसमें एल्गोरिदम, कोड, डेटासेट और मॉडल वेट शामिल हैं। प्रशिक्षण रिकॉर्ड लंबाई स्थिरता, इनाम स्कोर स्थिरता और एन्ट्रॉपी नियंत्रण में सुधार दिखाते हैं। पर्यावरण सेटअप कंडा और पिप का उपयोग करता है। इन्फेरेंस कोड और उदाहरण समस्याएं प्रदान की गई हैं। परियोजना verl फ्रेमवर्क पर बनी है। शोधकर्ताओं को GitHub इश्यू के माध्यम से चर्चा के लिए आमंत्रित किया जाता है।