HeadlinesBriefing favicon HeadlinesBriefing.com

RLCD क्या है? Jev के पीछे का रहस्य

Hacker News •
×

पेयरवाइज रिवॉर्ड मॉडलिंग से कैलिब्रेटेड, मल्टीवे निर्णयों तक, Jev एक भाषा मॉडल के विकल्प के रूप में देखे जाने पर रहस्यमय लगता है। जब इसे रिवॉर्ड मॉडलिंग में अगले कदम के रूप में देखा जाता है तो यह बहुत सरल हो जाता है। मुख्य विचार है: RLCD = मल्टीवे प्रेफरेंस मॉडलिंग + प्रायिकता कैलिब्रेशन। अधिक विशेष रूप से, RLCD एक स्कीमा-कंडीशन्ड Plackett–Luce उद्देश्य है। Jev टाइप किए गए आउटपुट और समानांतर अनुमान जोड़कर उस उद्देश्य को एक उत्पाद में बदल देता है। यही रहस्य है: रिवॉर्ड मॉडल अब जनरेटर के पीछे छिपा नहीं है। रिवॉर्ड मॉडल स्वयं मॉडल बन जाता है।

रिवॉर्ड मॉडलिंग एक स्केलर से शुरू हुई। एक पारंपरिक रिवॉर्ड मॉडल एक संदर्भ और एक उम्मीदवार उत्तर प्राप्त करता है, फिर एक स्केलर उत्पन्न करता है। परिणाम रिवॉर्ड मॉडल अंतिम उत्तर को स्कोर करते हैं। प्रक्रिया रिवॉर्ड मॉडल व्यक्तिगत तर्क चरणों को स्कोर करते हैं। दोनों मामलों में, सीखी गई वस्तु एक पूर्ण दिखने वाली संख्या है। समस्या यह है कि यह संख्या वास्तव में पूर्ण नहीं है। 0.8 का एक रिवॉर्ड समस्याओं, उम्मीदवार पूल, चेकपॉइंट या मॉडल परिवारों में एक स्थिर अर्थ नहीं रखता है। यह मुख्य रूप से समान परिस्थितियों में उत्पन्न उम्मीदवारों की तुलना करने के लिए उपयोगी है। परिचालन संकेत हमेशा सापेक्ष प्राथमिकता था।

PPRM ने प्राथमिकता को स्पष्ट किया। LLaMA-Berry का पेयरवाइज प्रेफरेंस रिवॉर्ड मॉडल, या PPRM, सीधे तुलना को उजागर करता है। एक समस्या और दो समाधान दिए जाने पर, PPRM उत्तर देता है: क्या पहला उत्तर दूसरे उत्तर से बेहतर है? यह Bradley–Terry मॉडल है। LLaMA-Berry तुलना को हाँ और नहीं टोकन पर एक बाधित भाषा-मॉडल निर्णय के रूप में लागू करता है। यह मूल्यांकनकर्ता को लगभग 7.8 मिलियन गणितीय-समाधान जोड़ों पर प्रशिक्षित करता है और पेयरवाइज भविष्यवाणी कार्य को बेहतर बनाने के लिए DPO का उपयोग करता है। आवश्यक परिवर्तन अवधारणात्मक है: रिवॉर्ड मॉडलिंग प्रेफरेंस-प्रायिकता मॉडलिंग बन जाती है।

Plackett–Luce मल्टीवे PPRM है। PPRM दो उम्मीदवारों की तुलना करता है। एक वास्तविक निर्णय इंटरफ़ेस आमतौर पर दो से अधिक प्राप्त करता है। प्रत्येक उम्मीदवार को एक संदर्भ-निर्भर उपयोगिता निर्दिष्ट करें, फिर सभी उम्मीदवारों को एक साथ सामान्यीकृत करें। यह Luce चॉइस मॉडल है, जिसे मल्टीनोमियल लॉगिट के रूप में भी जाना जाता है। जब K=2, यह ठीक Bradley–Terry में कम हो जाता है। इसलिए PPRM उसी चॉइस ज्योमेट्री का बाइनरी मामला है। यदि पर्यवेक्षण में एक पूर्ण रैंकिंग है, तो पूर्ण Plackett–Luce संभावना बार-बार अगले सबसे अच्छे शेष उम्मीदवार का चयन करती है।

मुख्य संस्थाएं: कंपनियां: LLaMA-Berry