تشرح هذه المقالة كيفية بناء نموذج قرار باستخدام نموذج لغة كبير (LLM) عن طريق تقييد المخرجات إلى مجموعة ثابتة من الخيارات، مثل أ إلى هـ. على عكس نماذج اللغة القياسية التي تولد الرموز بشكل متسلسل، فإن نماذج القرار مثل جيف تفترض خيارات ثابتة وتجري التنبؤات في مرور واحد. يُظهر المؤلف هذه التقنية باستخدام نموذج Qwen/Qwen3-1.7B، وتطبيق التشفير المقيد لتحديد المخرجات بالرموز المحددة مسبقًا. من خلال إخفاء جميع عناصر المفردات الأخرى، يمكن للنموذج إصدار الخيارات الصالحة فقط، ويتم اختيار الرمز ذي أعلى احتمال كإجابة.
تم اختبار هذا النهج على مجموعة بيانات CommonsenseQA، محققًا دقة تبلغ 59.38% دون ضبط دقيق. بعد ضبط دقيق سريع، تحسنت الدقة إلى 62.41%. تسلط المقالة أيضًا الضوء على قيد: احتمالات رموز الإخراج لا تعكس بالضرورة الثقة الحقيقية في الصواب، خاصةً على الأسئلة الغامضة. يوفر المؤلف تنفيذًا كاملاً بلغة بايثون باستخدام Hugging Face Transformers وPyTorch، يوضح كيفية تنسيق المطالبات، وتحميل النماذج، وحساب الاحتمالات لكل خيار. تقدم هذه الطريقة طريقة خفيفة الوزن لإعادة استخدام LLMs لمهام التفكير متعدد الخيارات.
الكيانات الرئيسية: الشركات: Hugging Face، Qwen
الأسئلة الشائعة: كيف يحسن التشفير المقيد اتخاذ القرار في نماذج LLM؟
التشفير المقيد يحد من مخرجات النموذج إلى مجموعة محددة مسبقًا من الرموز (مثل أ–هـ)، مما يتيح تنبؤات بالمرور الواحد. هذا يحاكي نماذج القرار مثل جيف ويقلل الحمل الحسابي عن طريق إزالة الحاجة إلى توليد الرموز التكراري.
المصدر: Hacker News · لخّصه HeadlinesBriefing