HeadlinesBriefing favicon HeadlinesBriefing.com

ما هو RLCD؟ السر وراء Jev

Hacker News •
×

من نمذجة المكافآت الزوجية إلى القرارات متعددة الاتجاهات المعايرة، يبدو Jev غامضًا عند النظر إليه كبديل لنموذج لغة. يصبح أبسط بكثير عند النظر إليه كخطوة تالية في نمذجة المكافآت. الفكرة الأساسية هي: RLCD = نمذجة التفضيل متعددة الاتجاهات + معايرة الاحتمال. بشكل أكثر تحديدًا، RLCD هو هدف Plackett–Luce مشروط بالمخطط. يحول Jev هذا الهدف إلى منتج بإضافة مخرجات منمطة واستدلال متوازي. هذا هو السر: لم يعد نموذج المكافأة مخفيًا خلف مولد. يصبح نموذج المكافأة هو النموذج.

بدأت نمذجة المكافآت بكمية قياسية. يتلقى نموذج المكافأة التقليدي سياقًا وإجابة مرشحة، ثم ينتج كمية قياسية. نماذج مكافأة النتيجة تسجل الإجابة النهائية. نماذج مكافأة العملية تسجل خطوات التفكير الفردية. في كلتا الحالتين، الكائن المتعلم هو رقم يبدو مطلقًا. المشكلة هي أن هذا الرقم ليس مطلقًا في الواقع. مكافأة 0.8 ليس لها معنى ثابت عبر المشكلات، مجموعات المرشحين، نقاط التفتيش، أو عائلات النماذج. إنها مفيدة بشكل أساسي لمقارنة المرشحين المولدين تحت ظروف مماثلة. كانت الإشارة التشغيلية دائمًا هي التفضيل النسبي.

جعل PPRM التفضيل صريحًا. نموذج مكافأة التفضيل الزوجي من LLaMA-Berry، أو PPRM، يكشف المقارنة مباشرة. عند إعطاء مشكلة وحلين، يجيب PPRM: هل الإجابة الأولى أفضل من الإجابة الثانية؟ هذا هو نموذج Bradley–Terry. ينفذ LLaMA-Berry المقارنة كقرار نموذج لغة مقيد على رموز نعم ولا. يدرب المقيم على ما يقرب من 7.8 مليون زوج من الحلول الرياضية ويستخدم DPO لتحسين مهمة التنبؤ الزوجي. التغيير الجوهري هو مفاهيمي: تصبح نمذجة المكافآت نمذجة احتمالية التفضيل.

Plackett–Luce هو PPRM متعدد الاتجاهات. يقارن PPRM مرشحين اثنين. واجهة القرار الحقيقية تتلقى عادة أكثر من اثنين. عيّن لكل مرشح فائدة تعتمد على السياق، ثم طبيع جميع المرشحين معًا. هذا هو نموذج اختيار Luce، المعروف أيضًا باسم logit متعدد الحدود. عندما K=2، يختزل تمامًا إلى Bradley–Terry. لذلك PPRM هو الحالة الثنائية لنفس هندسة الاختيار. إذا كانت الإشراف تحتوي على ترتيب كامل، فإن احتمالية Plackett–Luce الكاملة تختار بشكل متكرر أفضل مرشح تالي متبقي.

الكيانات الرئيسية: الشركات: LLaMA-Berry

الأسئلة الشائعة: ما هو RLCD؟

RLCD هو هدف Plackett–Luce مشروط بالمخطط يجمع بين نمذجة التفضيل متعددة الاتجاهات ومعايرة الاحتمال، محولاً نموذج المكافأة إلى النموذج نفسه.

سؤال الأسئلة الشائعة: ما هو RLCD؟

إجابة الأسئلة الشائعة: RLCD هو هدف Plackett–Luce مشروط بالمخطط يجمع بين نمذجة التفضيل متعددة الاتجاهات ومعايرة الاحتمال، محولاً نموذج المكافأة إلى النموذج نفسه.