HeadlinesBriefing favicon HeadlinesBriefing.com

اتفاق قضاة LLM: هل نثق بهم؟ نموذج Ising للجمع

Hacker News •
×

تخيل تقييم نظام توليد معزز بالاسترجاع حيث يقوم عدة قضاة من LLM بتقييم نفس المقطع. ثمانية يقولون 'ذو صلة'؛ اثنان يقولان 'غير ذي صلة'. ثمانية من أصل عشرة يبدو مقنعاً، لكن قوة الاتفاق تعتمد على استقلال القضاة. إذا شارك القضاة قوالب المحفزات، أو سلالة التدريب، أو عائلات النماذج، أو النقاط العمياء، فقد يكررون نفس الخطأ، مما يجعل أعداد الأصوات مضللة بقوة. تقدم الورقة 'تجميع التسميات مع مراعاة الاعتمادية لـ LLM كقاضٍ عبر نماذج Ising'، المشاركة في تأليفها مع Shiva Kasiviswanathan والمقدمة في ICML، طريقة لتقييم الارتباطات بين مخرجات القضاة وتعديل الدرجات المجمعّة لضمان تنوع الآراء. في الاختبارات على ثلاث مهام، تفوقت الطريقة على أفضل خط أساس — لجنة مرجحة بالدقة التاريخية — بنسبة 9% إلى 14% على المقاييس القياسية. يفترض التصويت بالأغلبية أن القضاة يرتكبون الأخطاء بشكل مستقل، وهو أمر متفائل جداً في كثير من الأحيان لأنظمة LLM كقاضٍ. قد يفشل قاضيان معاً بسبب تفسير مماثل للمعايير، أو أمثلة محفزات مشتركة، أو حساسية نموذج مشتركة. يمثل المجمع اللجنة كشبكة حيث يكون لكل قاضٍ ملف موثوقية وللأزواج علاقات، يتفقون أكثر من المتوقع أو يقدمون وجهات نظر تكميلية. تقوم الطريقة بنمذجة مهارة القاضي والتشابه باستخدام نموذج Ising، وهو نموذج إحصائي يمثل الاعتمادية الزوجية بين المتغيرات الثنائية. يوجد نوعان من النمذجة: أحدهما يعامل أنماط العلاقات على أنها متسقة عبر التسميات الإيجابية والسلبية، مع تعديل الأوزان للارتباط؛ والآخر، نموذج يعتمد على الفئة، يسمح لأنماط العلاقات بالتغير مع التسميات، مفيد عندما يتفق القضاة على العناصر الواضحة ولكن يتجمعون على العناصر الغامضة. تتعلم الطريقة غير الخاضعة للإشراف من مخرجات القضاة دون تسميات مرجعية بشرية، معاملة التسميات الحقيقية كمتغيرات كامنة لاستنتاج موثوقية القضاة واعتماديتهم بشكل مشترك.