HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache: LLM के बीच सीधा सिमेंटिक संचार

Hacker News •
×

मल्टी-LLM सिस्टम बेहतर प्रदर्शन के लिए विविध मॉडलों को जोड़ते हैं, लेकिन मौजूदा डिज़ाइन संचार को टेक्स्ट के माध्यम से मजबूर करते हैं, जिससे समृद्ध सिमेंटिक्स खो जाते हैं और टोकन-दर-टोकन लेटेंसी होती है। क्या LLM टेक्स्ट से परे संवाद कर सकते हैं? Oracle प्रयोग दिखाते हैं कि KV-Cache सिमेंटिक्स को समृद्ध करने से कैश आकार बढ़ाए बिना प्रतिक्रिया गुणवत्ता में सुधार होता है।

इस प्रकार, Cache-to-Cache (C2C) प्रस्तावित है: LLM के बीच सीधे सिमेंटिक संचार के लिए एक नया पैराडाइम। C2C एक न्यूरल नेटवर्क का उपयोग करके स्रोत मॉडल के KV-cache को प्रोजेक्ट और लक्ष्य मॉडल के साथ फ्यूज़ करता है, जिससे सीधा सिमेंटिक ट्रांसफर संभव होता है। एक सीखने योग्य गेटिंग मैकेनिज्म उन लक्ष्य परतों का चयन करता है जो कैश संचार से लाभान्वित होती हैं।

टेक्स्ट संचार की तुलना में, C2C दोनों मॉडलों से गहरे, विशेष सिमेंटिक्स का उपयोग करता है और स्पष्ट मध्यवर्ती टेक्स्ट जनरेशन से बचता है। प्रयोग दिखाते हैं कि C2C व्यक्तिगत मॉडलों की तुलना में 6.4-14.2% अधिक औसत सटीकता प्राप्त करता है, टेक्स्ट संचार से लगभग 3.1-5.4% बेहतर प्रदर्शन करता है, और लेटेंसी में औसतन 2.5x गति प्रदान करता है। कोड दिए गए URL पर उपलब्ध है।

मुख्य इकाइयाँ: व्यक्ति: Tianyu Fu