HeadlinesBriefing favicon HeadlinesBriefing.com

टर्नरी LLM के लिए 1.58-बिट बाधा को तोड़ना

Hacker News •
×

टर्नरी लार्ज लैंग्वेज मॉडल (LLM) प्रत्येक वजन को तीन प्रतीकों {-1,0,+1} में से एक के रूप में संग्रहीत करते हैं, इसलिए एक टर्नरी मॉडल की लागत पारंपरिक रूप से सूचना-सैद्धांतिक log₂ 3 ≈ 1.585 बिट प्रति वजन के संदर्भ में होती है। प्रचलित तैनाती प्रारूप पांच टर्नरी वजनों को एक बाइट में पैक करता है (पांच-ट्रिट पैकिंग), और व्यवहार में उपयोग किए जाने वाले दो की घात समूह आकारों के कारण यह 1.625 बिट प्रति वजन तक पूर्णांकित हो जाता है।

यह प्रभावी भंडारण बिट-चौड़ाई तीन प्रतीकों को समान संभाव्यता वाले मानती है। हम 29 टर्नरी LLM मॉडलों के वास्तविक प्रतीक वितरण को मापते हैं और पाते हैं कि शून्य सभी वजनों का 51.5% तक होते हैं। इस खोज से प्रेरित होकर, हम BITCOS प्रस्तुत करते हैं, एक सरल वितरण-अनुकूली लेआउट जिसमें एक सघन उपस्थिति बिटमैप और एक संकुचित चिह्न वेक्टर शामिल है, और मॉडल के वजनों में शून्य घनत्व z दिए जाने पर प्रति वजन तत्व 2 - z बिट की लागत आती है।

BITCOS 29 परीक्षण किए गए मॉडलों में से 26 में पांच-ट्रिट पैकिंग की तुलना में अधिक कॉम्पैक्ट रूप से वजन संग्रहीत करता है, और उनमें से सबसे विरल पर 1.485 बिट प्रति वजन तक पहुंचता है। BITCOS आधुनिक प्रोसेसरों और GPUs पर कुशल अनपैकिंग के लिए उपयुक्त है, और हम AVX-512, AVX2 और Intel Xe2 GPUs के लिए अनुकूलित अनपैकिंग अनुक्रम प्रस्तुत करते हैं।

उत्पादन अत्याधुनिक टर्नरी मैट्रिक्स-वेक्टर गुणन कर्नेल के विरुद्ध मापा गया, वास्तविक दुनिया के टर्नरी मॉडलों द्वारा प्रदर्शित शून्य घनत्वों पर, हमारे प्रस्तावित लेआउट के साथ प्राप्त लाभ 1.28× तक है। अंत में, हम 5 विभिन्न प्लेटफार्मों पर एंड-टू-एंड LLM अनुमान परिणामों का वर्णन करते हैं जहां डिकोड थ्रूपुट CPUs पर 1.18× और GPUs पर 1.27× तक सुधरता है।

मुख्य संस्थाएं: कंपनियां: Intel | व्यक्ति: Evangelos Georganas