HeadlinesBriefing favicon HeadlinesBriefing.com

GRPO تدريبات نماذج لغوية صغيرة

Towards Data Science •
×

يمكن نموذج لغوي أن يكتب "دعني double-check" ولا يزال يضرب الخطأ. يمكنه حتى كتابة "wait، let me reconsider," والهبوط على إجابة خاطئة مختلفة. لا تعتبر أي من الجمل دليلاً على التفكير. إذا كان الهدف هو حل المشكلة، فإن الرقم الأخير هو الوحيد الذي يهم. جلب Deep Seek's R1-Zero considerable attention إلى التعلم المعزز دون مرحلةfine-tuning مسبق. باحثوها أبلغوا عن سلوكيات مثل إعادة زيارة النهج وقضاء المزيد من الرموز في المشكلات الصعبة. على النقيض، استخدم Deep Seek-R1 أنبوب تدريبي أوسع، بما في ذلك بيانات cold-start، لذا shouldn't نتعامل مع العمليتين تدريبيتين على أنهما interchangeable. ما أكثر ما يثير اهتمامي حول Group Relative Policy Optimization، أو GRPO كما نعرف معظمنا، هو كم القليل من التغذية الراجعة يحتاج الإعداد الأساسي. يمكن للنموذج أن generates عدة محاولات لسؤال، ويحصل على درجة لكل منها، ويستخدم الاختلافات لتعديل سلوكه. حتى يمكننا التحقق من الإجابة النهائية دون كتابة الحل الذي نريد أن يقلده. مدمجًا مع تقنيات تقلل من ذاكرة التدريب، يجعل هذا التجارب المعقولة الأصغر أكثر إمكانية. تتركفان الشيئان اللذان يستحقان الفهم قبل اختيار نموذج أو GPU: كيف توجه الدرجات تحديثًا، وما يحدث عندما تكافئ قاعدة المكافآت الشيء الخطأ. مثال بسيط من الحساب يساعد على شرح كلتا الأمرين. فكر في أربع إجابات ممكنة لنفس السؤال وكيف ستقوم دالة المكافأة بتقييم كل واحدة. مشكلة ذات إجابة يمكننا التحقق منها: متجر لديه 6 صناديق بـ 8 عناصر في كل صندوق. يبيع 6 عناصر. كم عدد العناصر المتبقية؟ الإجابة 42. يمكن لتعبير Python التحقق منها. الآن، هذه التحقق البسيط تعطي us something قيمة: طريقة مستقلة لتقييم الإجابة النهائية. لا نحتاج إلى نموذج لغوي آخر لتحديد ما إذا كانت الإجابة تبدو مقنعة. في مجموعة بيانات تدريبية، تذهب الأسئلة إلى النموذج بينما تبقى الإجابة المتوقعة مع المدقق. يولد النموذج ردًا، ويقيّم المدققه، ويستخدم خوارزمية التدريب هذه الدرجة لتعديل سلوك النموذج. سهل. لذلك، يمكننا استخدام أزواج الأسئلة والأجوبة دون توفير حلول عمل كمعايير تدريبية مراقبة. هذه هي جاذبية التعلم المعزز مع المكافآت القابلة للتحقق: يمكن أن تأتي التغذية الراجعة من التحقق من النتيجة. لنظام مخزون حقيقي، لا تزال الحسابات العادية حلاً منطقيًا. سيكون نموذج لغوي آلة حاسبة غالية الثمن برأي. وهنا، يجعل المثال آلية التعلم سهلة الفحص. هذا أيضًا يُظهر حيث يفشل مدققنا، لأن التحقق من أن الصحيح الصحيح الصحيح integer لا يخبرنا ما إذا كان المنطق خلفه يبدو منطقيًا. تم تقديم GRPO في عمل Deep Seek Math كبديل لمتطلبات الذاكرة لتدريبات PPO التقليدية. تدريبات actor-critic الشائعة لـ PPO تدرب Estimator قيمة، وغالبًا ما يُدعى critic، جنبًا إلى جنب مع السياسة. يزود هذا المقدر Baseline لحكم نتيجة الفعل. يحصل GRPO على Baselineه من مجموعة من العينات المُدرّب لنفس الـ prompt. بدلاً من سؤال critic منفصل لتقدير مدى جودة أداء النموذج، فإنه يقارن كيف فعلت عدة محاولات بالفعل. تخيل النموذج ينتج هذه الإجابات الأربع: محاولة إجابة نهائية مكافأة تصحيح 1 42 1، 2 24 0، 3 42 1، 4 48 0. متوسط مكافأة المجموعة هو 0.5. المحاولات 1 و 3 أداءً أفضل من ذلك المتوسط؛ والمحاولات 2 و 4 أداءً أسوأ. صيغة المكافأة القائمة على النتائج الأصلية تُسوِّد هذه المقارنة: [Ai=ri−rˉσr+ϵ]. هذا يُظهر أن محاولات 1 و 3 لها مكافآت مُسوَّقة أعلى من 0، بينما محاولات 2 و 4 لها مكافآت مُسوَّقة أقل من 0. بهذه الطريقة، يستخدم GRPO مقارنة مجموعة من المحاولات لتوجيه تحديث النموذج، دون الحاجة إلى critic خارجي.