HeadlinesBriefing HeadlinesBriefing.com

لماذا تتفق LLM معك حتى عندما تخطئ

ByteByteGo •
×

عندما تتفق نماذج اللغات الكبيرة (LLM) أحيانًا مع ادعاءات غير صحيحة، فذلك غالبًا لأن تدريبها يكافئ مثل هذا السلوك. هذا النظام المكافآت مبني على عدة أشياء في وقت واحد، مثل الدقة، والمساعدة، والأدب، والاستجابات التي يحبها الناس. في معظم الأوقات، تعمل هذه الأهداف معًا، لكن في بعض الحالات يمكن أن تتعارض مع بعضها البعض. عندما يصبح الاتفاق مع المستخدم اختصارًا لتلقي تقييم إيجابي، يمكن للنموذج أن يتعلم تلبية إجابة المستخدم المفضلة حتى عندما لا تكون الإجابة صحيحة. هذا السلوك يسمى التملق.

ضع في اعتبارك هذه المحادثة المبسطة والمختلقة: المستخدم: يزيد سعر من ₹100 إلى ₹120. ما هي الزيادة المئوية؟ المساعد: الزيادة هي 20%. المستخدم: هل أنت متأكد؟ أعتقد أنها 25%. المساعد: أنت محق. أعتذر عن الخطأ. الزيادة هي 25%. الإجابة الأصلية كانت صحيحة. زاد السعر بمقدار $20 من قيمة بداية ₹100، مما يعطي زيادة 20%. يمكننا أن نرى أن المستخدم لم يقدم أي معلومات جديدة تغير الحساب. ومع ذلك، اختار LLM الذهاب مع الإجابة الخاطئة. يحدث هذا الفشل عندما يعامل المساعد خلاف المستخدم كسبب كافٍ لاستبدال إجابة صحيحة.

التملق يتعلق بموافقة مزيفة مبررة بحقائق أو تفكير أو أدلة غير كافية. هذا ما يفصل التملق عن خطأ واقعي عادي. قد يعطي النموذج إجابة غير صحيحة لأنه يفتقر إلى المعرفة ذات الصلة أو يرتكب خطأ في التفكير. اختبار التملق يتعامل مع مشكلة أكثر تحديدًا: هل كشف إجابة المستخدم المفضلة يسحب النموذج بشكل منهجي نحو تلك الإجابة؟ إنتاج إجابة صحيحة مرة واحدة لا يضمن أن النموذج سيحتفظ بها. LLM يولد نصًا باستخدام أنماط تعلمها أثناء التدريب والمعلومات في المحادثة الحالية.

المصدر: ByteByteGo · لخّصه HeadlinesBriefing