एम्बेडिंग जेम्मा 2 ऑन-डिवाइस मल्टीमॉडल एम्बेडिंग के लिए सबसे सक्षम मॉडल है, जो टेक्स्ट, इमेज, ऑडियो और वीडियो को मूल रूप से एकीकृत एम्बेडिंग स्पेस में मैप करता है। Google DeepMind द्वारा पेश किया गया, यह मूल एम्बेडिंग जेम्मा पर विस्तार करता है, जिसे 20 मिलियन से अधिक डाउनलोड मिले। Gemma 4 आर्किटेक्चर पर Apache 2.0 लाइसेंस के तहत निर्मित, इसमें 740 मिलियन पैरामीटर हैं, जो ऑन-डिवाइस इन्फ्रेंस के लिए अनुकूलित है।
यह MTEB Code और MAEB जैसे बेंचमार्क पर sub-1B मल्टीमॉडल एम्बेडर्स के बीच अग्रणी स्कोर प्राप्त करता है, बड़े मॉडलों से मेल खाता है या उनसे बेहतर प्रदर्शन करता है। मॉड्यूलर डिज़ाइन के लिए टेक्स्ट-ओनली कार्यों के लिए केवल 270M पैरामीटर की आवश्यकता होती है, वैकल्पिक विज़न और ऑडियो एन्कोडर के साथ। Matryoshka Representation Learning का उपयोग करके, आउटपुट वैक्टर को 768 आयामों से 128 आयामों तक छोटा किया जा सकता है, जिससे स्टोरेज में 6 गुना तक की कमी आती है।
एज हार्डवेयर के लिए अनुकूलित, यह Google Pixel 11 Pro पर टेक्स्ट-ओनली के लिए ~191MB सक्रिय RAM और पूर्ण मल्टीमॉडल मॉडल के लिए ~567MB के साथ चलता है। इसमें 8K टोकन कॉन्टेक्स्ट विंडो है, जो पहले से 4 गुना बड़ी है, जो 5.5 मिनट के ऑडियो, 29 इमेज या 58 वीडियो फ्रेम तक प्रोसेस करती है। यह MTEB Code में 68.76 से 78.68 तक कोड प्रदर्शन में 9.92-पॉइंट सुधार दिखाता है।
एम्बेडिंग जेम्मा 2 पूरी तरह से ऑन-डिवाइस सिमेंटिक सर्च, रूटिंग और रिट्रीवल को सक्षम बनाता है, डेटा प्राइवेसी और कम लेटेंसी सुनिश्चित करता है। यह ऑन-डिवाइस RAG पाइपलाइनों के लिए Gemma 4 जैसे जनरेटिव मॉडल के साथ जोड़ा जाता है, कम मेमोरी फुटप्रिंट के साथ एकीकृत पाइपलाइन के लिए टोकनाइज़र और ऑडियो एन्कोडर साझा करता है।
स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित