HeadlinesBriefing favicon HeadlinesBriefing.com

अनंत-पैरामीटर LLM: लाइव डेटा से भार

Hacker News •
×

स्केलिंग नियम मानते हैं कि भाषा मॉडल अधिक पैरामीटर और प्रशिक्षण डेटा के साथ अधिक सक्षम होता है। मिश्रण-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर ने इन नियमों का पालन करते हुए उल्लेखनीय परिणाम प्राप्त किए हैं, प्रति टोकन विशाल संग्रहीत पैरामीटर बैंक का केवल एक अंश सक्रिय करते हुए।

यह सफलता स्थिर प्रीट्रेनिंग डेटा पर आधारित है। तैनात मॉडल एक अलग दुनिया का सामना करता है, जहाँ इसे अधिक उपयोगी बनाने वाला अधिकांश डेटा इसके प्रशिक्षण सेट में नहीं, बल्कि उस लाइव इंटरैक्शन में होता है जिसे वह वर्तमान में संभाल रहा है, जैसे उपयोगकर्ता द्वारा प्रदान किए गए तथ्य या दिए गए सुधार। एक पारंपरिक मॉडल इस डेटा से सीख नहीं सकता, क्योंकि इसके भार प्रशिक्षण के बाद जमे हुए हैं। इसके बजाय, रन टाइम पर प्रदान किया गया ज्ञान और व्यवहार प्रॉम्प्ट में रखा जाता है और अनुरोध समाप्त होने पर त्याग दिया जाता है।

हम पूछते हैं कि एक आर्किटेक्चर लाइव इंटरैक्शन को अपने भार में लिखकर उससे कैसे सीख सकता है। MoE से प्रेरणा लेते हुए, हम अनंत-पैरामीटर LLM प्रस्तावित करते हैं। एक कॉम्पैक्ट हाइपरनेटवर्क रन-टाइम डेटा को साझा बेस नेटवर्क के लो-रैंक मॉड्यूलेशन में बदलता है, इसलिए फीड-फॉरवर्ड भार लाइव डेटा से उत्पन्न होते हैं, न कि एक निश्चित बैंक में संग्रहीत होते हैं। जहाँ पूर्व भार जनरेटर संदर्भ को एक बार पढ़ते हैं और जम जाते हैं, वहाँ हम जनरेटर के लेटेंट कोड पर एक बायेसियन विश्वास रखते हैं और इसे ऑनलाइन अपडेट करते हैं।

संग्रहीत फुटप्रिंट स्थिर रहता है, फिर भी मॉडल जो भार संकलित कर सकता है वे प्रभावी रूप से अनंत हैं। रन-टाइम ज्ञान को प्रॉम्प्ट के बजाय भार में रखना गणना में परिशोधित होता है, संदर्भ विंडो को मुक्त करता है, टर्न में बना रहता है, और बेहतर सामान्यीकरण कर सकता है। हम एक मूल्यांकन प्रोटोकॉल निर्दिष्ट करते हैं जो इसे इन-कॉन्टेक्स्ट लर्निंग और रिट्रीवल के विरुद्ध परीक्षण करता है।

मुख्य संस्थाएँ: व्यक्ति: Jinli Hu