HeadlinesBriefing favicon HeadlinesBriefing.com

LLM न्यायाधीशों की सहमति: क्या भरोसा करें? Ising मॉडल

Hacker News •
×

कल्पना करें कि एक पुनर्प्राप्ति-संवर्धित-पीढ़ी प्रणाली का मूल्यांकन किया जा रहा है जहां कई LLM न्यायाधीश उसी पैसेज का मूल्यांकन करते हैं। आठ 'प्रासंगिक' कहते हैं; दो 'प्रासंगिक नहीं' कहते हैं। दस में से आठ आश्वस्त करने वाला लगता है, लेकिन सहमति की ताकत न्यायाधीशों की स्वतंत्रता पर निर्भर करती है। यदि न्यायाधीश प्रॉम्प्ट टेम्पलेट्स, प्रशिक्षण वंशावली, मॉडल परिवार, या ब्लाइंड स्पॉट साझा करते हैं, तो वे वही गलती दोहरा सकते हैं, जिससे वोट काउंट भ्रामक रूप से मजबूत हो जाते हैं। पेपर 'Ising मॉडल के माध्यम से LLM-एज़-अ-जज के लिए निर्भरता-जागरूक लेबल एकत्रीकरण', Shiva Kasiviswanathan के साथ सह-लेखक और ICML में प्रस्तुत, न्यायाधीशों के आउटपुट के बीच सहसंबंधों का आकलन करने और राय विविधता सुनिश्चित करने के लिए समेकित स्कोर को समायोजित करने की एक विधि प्रस्तुत करता है। तीन कार्यों पर परीक्षण में, विधि ने सर्वश्रेष्ठ-प्रदर्शन करने वाले बेसलाइन — ऐतिहासिक सटीकता द्वारा भारित एक पैनल — को मानक मेट्रिक्स पर 9% से 14% तक पीछे छोड़ दिया। बहुमत वोट मानता है कि न्यायाधीश स्वतंत्र रूप से त्रुटियां करते हैं, जो LLM-एज़-अ-जज सिस्टम के लिए अक्सर बहुत आशावादी होता है। दो न्यायाधीश समान रूब्रिक व्याख्या, साझा प्रॉम्प्ट उदाहरण, या साझा मॉडल संवेदनशीलता के कारण एक साथ विफल हो सकते हैं। एग्रीगेटर पैनल को एक नेटवर्क के रूप में मॉडल करता है जहां प्रत्येक न्यायाधीश की एक विश्वसनीयता प्रोफ़ाइल होती है और जोड़े के संबंध होते हैं, जो भविष्यवाणी से अधिक बार सहमत होते हैं या पूरक दृष्टिकोण प्रदान करते हैं। विधि न्यायाधीश कौशल और समानता को Ising मॉडल का उपयोग करके मॉडल करती है, एक सांख्यिकीय मॉडल जो बाइनरी चर के बीच जोड़ीदार निर्भरता का प्रतिनिधित्व करता है। दो मॉडलिंग वेरिएंट मौजूद हैं: एक सकारात्मक और नकारात्मक लेबल में संबंध पैटर्न को सुसंगत मानता है, सहसंबंध के लिए वजन समायोजित करता है; दूसरा, एक क्लास-निर्भर मॉडल, लेबल के साथ संबंध पैटर्न को बदलने देता है, उपयोगी जब न्यायाधीश स्पष्ट वस्तुओं पर सहमत होते हैं लेकिन अस्पष्ट पर क्लस्टर करते हैं। अनपर्यवेक्षित विधि मानव संदर्भ लेबल के बिना न्यायाधीश आउटपुट से सीखती है, सच्चे लेबल को गुप्त चर के रूप में मानकर न्यायाधीश विश्वसनीयता और निर्भरता को संयुक्त रूप से अनुमानित करती है।