HeadlinesBriefing favicon HeadlinesBriefing.com

التعلم المعزز لنماذج اللغة الكبيرة: تأثير ماثيو ولا تستسلم أبدًا

Hacker News •
×

تناقش هذه التدوينة ورقة بحثية حول التدريب اللاحق بالتعلم المعزز لنماذج اللغة الكبيرة، وتقدم تأثير ماثيو وتقترح 'لا تستسلم أبدًا' لحله. يقدم المؤلف بشكل تفاعلي، مع تفاصيل تقنية أعمق في الورقة والكود.

كل ممارس للتعلم المعزز رأى منحنى تقييم يرتفع، مثل AIME 2025 أثناء تدريب Olmo 3.1 RL-Zero Math. لكن ماذا يعني ذلك؟ عند تقسيم 30 سؤالًا من AIME إلى مستويات صعوبة بناءً على pass@32 الأولي، نجد أن المسائل السهلة تتحسن بشكل كبير، بينما المسائل الصعبة (pass@32 الأولي=0) بالكاد تتحسن. أخفى المتوسط ذلك: المكاسب تأتي من المسائل الأسهل. هذا هو تأثير ماثيو.

نرى شيئًا مشابهًا في التعلم المعزز للكود والتعلم المعزز الوكيلي باستخدام Deepcoder وDeep SWE. المكاسب تتناسب مع الكفاءة الأولية. نربط هذا بتأثير ماثيو في علم الشبكات والاقتصاد: 'الأغنياء يزدادون غنى'. تأثير ماثيو في التعلم المعزز لنماذج اللغة الكبيرة: يحسّن التعلم المعزز الأداء بما يتناسب مع الكفاءة الأولية—المهام السهلة تصبح أسهل، والمهام الصعبة تبقى صعبة.

الأسباب؟ ليس GRPO فقط. إذا لم يكن هناك إجابة صحيحة في k عينات، فلا يوجد تدرج. أحد الحلول: أخذ عينات من إكمالات أكثر (k أكبر). نختبر مع Qwen 2.5 0.5B Instruct على GSM8k platinum، مع تغيير k.