HeadlinesBriefing favicon HeadlinesBriefing.com

LLM ليست مجرد متنبئات بالرمز التالي

Hacker News •
×

بالمعنى الدقيق، القول بأن "LLM هي متنبئات بالرمز التالي" ليس خطأ، لكنه غير مكتمل. إنه تقريب جيد من الدرجة الصفرية، وهو مبني على شيء حقيقي: نماذج اللغة القائمة على المحولات تُصدر الرموز بشكل تلقائي تراجعي. أثناء التدريب المسبق، يأخذ النموذج بشكل متكرر بعض الرموز السابقة، وينظر إلى الرمز الذي تبعها فعليًا، ويجعل هذا الرمز أكثر احتمالًا ليتم أخذ عينة منه بعد ذلك.

النقطة الأساسية هي أن كل رمز تالٍ فعلي يأتي من تسلسل موجود في بيانات التدريب. ربما يكون من العدل أن نقول إن النموذج الأساسي يتصرف أيضًا كمتنبئ بالرمز التالي. لكن نماذج LLM التي نستخدمها ليست مجرد نماذج أساسية. إنها مدربة بعد التدريب، وجزء رئيسي من التدريب اللاحق الحديث هو التعلم المعزز بالمكافآت القابلة للتحقق (RLVR). أثناء التدريب المسبق، يتعلم النموذج فقط من التسلسلات الموجودة بالفعل في بيانات التدريب. أثناء RLVR، يستكشف النموذج عن طريق توليد تسلسلات جديدة والتعلم من نتائجها.

تشبيه الشطرنج يجعل هذا التمييز أسهل في الفهم. النظام الأول يُدرب على قاعدة بيانات كبيرة من مباريات الأساتذة الكبار ويتنبأ بالحركة التي سيلعبها الأستاذ الكبير على الأرجح بعد ذلك. الثاني هو محرك شطرنج مثالي استكشف كل لعبة ممكنة ويختار الحركة التي تؤدي إلى أعلى احتمال للفوز. تسمية النظام الثاني "متنبئ بالحركة التالية" سيكون غريبًا.

تقنيات التدريب اللاحق الأخرى مهمة أيضًا. التعلم المعزز من التغذية البشرية (RLHF) يدفع النموذج نحو محاكاة مساعد مفيد. RLVR يذهب أبعد من ذلك: يسمح لنموذج LLM بالاستكشاف والتعلم من تسلسلاته المولدة الخاصة.

الأسئلة الشائعة: لماذا القول بأن LLM مجرد متنبئات بالرمز التالي غير مكتمل؟

على الرغم من أن LLM تُصدر الرموز بشكل تلقائي تراجعي، فإن التدريب اللاحق مع RLVR يسمح لها بتعلم تسلسلات جديدة مولدة من الاستكشاف، وليس فقط البيانات الموجودة. هذا يجعلها أقرب إلى صانعات قرارات تحسن المكافآت من مجرد متنبئات بسيطة.