HeadlinesBriefing favicon HeadlinesBriefing.com

LLM के लिए RL: मैथ्यू प्रभाव और कभी हार न मानें

Hacker News •
×

यह ब्लॉग पोस्ट LLM के RL पोस्ट-ट्रेनिंग पर एक पेपर पर चर्चा करता है, मैथ्यू प्रभाव पेश करता है और इसे हल करने के लिए 'कभी हार न मानें' प्रस्तावित करता है। लेखक इंटरैक्टिव रूप से प्रस्तुत करता है, पेपर और कोड में गहरे तकनीकी विवरण हैं।

हर RL प्रैक्टिशनर ने एक eval कर्व को ऊपर जाते देखा है, जैसे Olmo 3.1 RL-Zero Math के प्रशिक्षण के दौरान AIME 2025। लेकिन इसका क्या मतलब है? 30 AIME प्रश्नों को प्रारंभिक pass@32 के आधार पर कठिनाई स्तरों में विभाजित करने पर, हम पाते हैं कि आसान समस्याएं नाटकीय रूप से सुधरती हैं, जबकि कठिन समस्याएं (प्रारंभिक pass@32=0) मुश्किल से सुधरती हैं। औसत ने इसे छिपा दिया: लाभ आसान समस्याओं से आते हैं। यह मैथ्यू प्रभाव है।

हम Deepcoder और Deep SWE का उपयोग करते हुए कोड RL और एजेंटिक RL में समान देखते हैं। लाभ प्रारंभिक क्षमता के समानुपाती होते हैं। हम इसे नेटवर्क विज्ञान और अर्थशास्त्र में मैथ्यू प्रभाव से जोड़ते हैं: 'अमीर और अमीर होते जाते हैं।' LLM के लिए RL में मैथ्यू प्रभाव: RL प्रारंभिक क्षमता के अनुपात में प्रदर्शन में सुधार करता है—आसान कार्य आसान हो जाते हैं, कठिन कार्य कठिन बने रहते हैं।

कारण? केवल GRPO नहीं। यदि k नमूनों में कोई सही उत्तर नहीं है, तो कोई ग्रेडिएंट नहीं। एक समाधान: अधिक कम्पलीशन सैंपल करें (बड़ा k)। हम GSM8k platinum पर Qwen 2.5 0.5B Instruct के साथ परीक्षण करते हैं, k को बदलते हुए।