EmbeddingGemma 2: An open, lightweight multimodal embedding model
🇬🇧 English
Embedding Gemma 2 is the most capable model for on-device multimodal embeddings, natively mapping text, images, audio, and video into a unified embedding space. Introduced by Google DeepMind, it expands on the original Embedding Gemma, which saw over 20 million downloads. Built on the Gemma 4 architecture under an Apache 2.0 license, it has 740 million parameters, optimized for on-device inference.
It achieves leading scores among sub-1B multimodal embedders on benchmarks like MTEB Code and MAEB, matching or outperforming larger models. Modular design requires as little as 270M parameters for text-only tasks, with optional vision and audio encoders. Using Matryoshka Representation Learning, output vectors can be truncated from 768 down to 128 dimensions, reducing storage by up to 6x.
Optimized for edge hardware, it runs with as little as ~191MB active RAM on a Google Pixel 11 Pro for text-only, and ~567MB for full multimodal. It features an 8K token context window, 4x larger than before, processing up to 5.5 minutes of audio, 29 images, or 58 video frames. It shows a 9.92-point improvement on code performance, from 68.76 to 78.68 in MTEB Code.
Embedding Gemma 2 enables fully on-device semantic search, routing, and retrieval, ensuring data privacy and low latency. It pairs with generative models like Gemma 4 for on-device RAG pipelines, sharing tokenizer and audio encoder for a unified pipeline with lower memory footprint.
🇸🇦 العربية
Embedding Gemma 2: نموذج متعدد الوسائط على الجهاز
Embedding Gemma 2 هو النموذج الأكثر قدرة على التضمين متعدد الوسائط على الجهاز، حيث يقوم بربط النصوص والصور والصوت والفيديو بشكل أصلي في فضاء تضمين موحد. تم تقديمه بواسطة Google DeepMind، وهو يوسع نطاق Embedding Gemma الأصلي الذي شهد أكثر من 20 مليون تنزيل. مبني على بنية Gemma 4 بموجب ترخيص Apache 2.0، ويمتلك 740 مليون معلمة، محسّن للاستدلال على الجهاز.
يحقق نتائج رائدة بين أدوات التضمين متعددة الوسائط التي تقل عن 1B معلمة في معايير مثل MTEB Code وMAEB، مما يضاهي أو يتفوق على النماذج الأكبر. يتطلب التصميم المعياري ما لا يقل عن 270M معلمة للمهام النصية فقط، مع مشفرات اختيارية للرؤية والصوت. باستخدام Matryoshka Representation Learning، يمكن تقليص متجهات الإخراج من 768 بُعدًا إلى 128 بُعدًا، مما يقلل التخزين بنسبة تصل إلى 6 مرات.
محسّن للأجهزة الطرفية، يعمل مع حوالي 191MB من ذاكرة الوصول العشوائي النشطة على Google Pixel 11 Pro للنص فقط، وحوالي 567MB للنموذج متعدد الوسائط الكامل. يتميز بنافذة سياق 8K رمز، أكبر 4 مرات من السابق، لمعالجة ما يصل إلى 5.5 دقيقة من الصوت، أو 29 صورة، أو 58 إطار فيديو. يُظهر تحسنًا بمقدار 9.92 نقطة في أداء الكود، من 68.76 إلى 78.68 في MTEB Code.
يتيح Embedding Gemma 2 البحث الدلالي والتوجيه والاسترجاع بالكامل على الجهاز، مما يضمن خصوصية البيانات وزمن انتقال منخفض. يتزاوج مع النماذج التوليدية مثل Gemma 4 لخطوط أنابيب RAG على الجهاز، ويشارك المُرمّز ومشفر الصوت لخط أنابيب موحد مع بصمة ذاكرة أقل.
ما هو Embedding Gemma 2؟
Embedding Gemma 2 هو نموذج تضمين متعدد الوسائط خفيف الوزن من Google DeepMind يربط النصوص والصور والصوت والفيديو في فضاء تضمين موحد، محسّن للاستدلال على الجهاز مع 740M معلمة.
🇧🇩 বাংলা
এম্বেডিং জেমা 2: মাল্টিমোডাল অন-ডিভাইস মডেল
এম্বেডিং জেমা 2 হল অন-ডিভাইস মাল্টিমোডাল এম্বেডিংয়ের জন্য সবচেয়ে সক্ষম মডেল, যা টেক্সট, ইমেজ, অডিও এবং ভিডিওকে একটি ইউনিফাইড এম্বেডিং স্পেসে নেটিভলি ম্যাপ করে। Google DeepMind দ্বারা প্রবর্তিত, এটি মূল এম্বেডিং জেমাকে প্রসারিত করে, যা 20 মিলিয়নেরও বেশি ডাউনলোড দেখেছে। Gemma 4 আর্কিটেকচারের উপর Apache 2.0 লাইসেন্সের অধীনে নির্মিত, এতে 740 মিলিয়ন প্যারামিটার রয়েছে, যা অন-ডিভাইস ইনফারেন্সের জন্য অপ্টিমাইজ করা।
এটি MTEB Code এবং MAEB-এর মতো বেঞ্চমার্কে sub-1B মাল্টিমোডাল এম্বেডারদের মধ্যে শীর্ষস্থানীয় স্কোর অর্জন করে, বড় মডেলগুলির সাথে মেলে বা তাদের ছাড়িয়ে যায়। মডুলার ডিজাইনের জন্য টেক্সট-অনলি কাজের জন্য মাত্র 270M প্যারামিটার প্রয়োজন, ঐচ্ছিক ভিশন এবং অডিও এনকোডার সহ। Matryoshka Representation Learning ব্যবহার করে, আউটপুট ভেক্টরগুলিকে 768 ডাইমেনশন থেকে 128 ডাইমেনশনে ছোট করা যায়, স্টোরেজ 6 গুণ পর্যন্ত কমিয়ে।
এজ হার্ডওয়্যারের জন্য অপ্টিমাইজ করা, এটি Google Pixel 11 Pro-তে টেক্সট-অনলির জন্য ~191MB সক্রিয় RAM এবং সম্পূর্ণ মাল্টিমোডাল মডেলের জন্য ~567MB সহ চলে। এটিতে একটি 8K টোকেন কনটেক্সট উইন্ডো রয়েছে, যা আগের চেয়ে 4 গুণ বড়, 5.5 মিনিট অডিও, 29টি ইমেজ বা 58টি ভিডিও ফ্রেম প্রক্রিয়া করে। এটি MTEB Code-এ 68.76 থেকে 78.68 পর্যন্ত কোড পারফরম্যান্সে 9.92-পয়েন্ট উন্নতি দেখায়।
এম্বেডিং জেমা 2 সম্পূর্ণ অন-ডিভাইস সিম্যান্টিক সার্চ, রাউটিং এবং রিট্রিভাল সক্ষম করে, ডেটা প্রাইভেসি এবং কম লেটেন্সি নিশ্চিত করে। এটি অন-ডিভাইস RAG পাইপলাইনের জন্য Gemma 4-এর মতো জেনারেটিভ মডেলের সাথে জোড়া দেয়, কম মেমরি ফুটপ্রিন্ট সহ একটি ইউনিফাইড পাইপলাইনের জন্য টোকেনাইজার এবং অডিও এনকোডার শেয়ার করে।
এম্বেডিং জেমা 2 কী?
এম্বেডিং জেমা 2 হল Google DeepMind-এর একটি লাইটওয়েট মাল্টিমোডাল এম্বেডিং মডেল যা টেক্সট, ইমেজ, অডিও এবং ভিডিওকে একটি ইউনিফাইড এম্বেডিং স্পেসে ম্যাপ করে, 740M প্যারামিটার সহ অন-ডিভাইস ইনফারেন্সের জন্য অপ্টিমাইজ করা।
🇩🇪 Deutsch
Embedding Gemma 2: Multimodales On-Device-Modell
Embedding Gemma 2 ist das leistungsfähigste Modell für multimodale On-Device-Embeddings, das Text, Bilder, Audio und Video nativ in einen einheitlichen Embedding-Raum abbildet. Eingeführt von Google DeepMind, erweitert es das ursprüngliche Embedding Gemma, das über 20 Millionen Downloads verzeichnete. Basierend auf der Gemma-4-Architektur unter einer Apache-2.0-Lizenz verfügt es über 740 Millionen Parameter, optimiert für On-Device-Inferenz.
Es erzielt führende Ergebnisse unter sub-1B multimodalen Embeddern in Benchmarks wie MTEB Code und MAEB und übertrifft oder erreicht größere Modelle. Das modulare Design erfordert nur 270M Parameter für reine Textaufgaben, mit optionalen Vision- und Audio-Encodern. Mittels Matryoshka Representation Learning können Ausgabevektoren von 768 auf 128 Dimensionen gekürzt werden, was den Speicher um bis zu 6x reduziert.
Optimiert für Edge-Hardware, läuft es mit nur ~191 MB aktivem RAM auf einem Google Pixel 11 Pro für Text und ~567 MB für das vollständige multimodale Modell. Es verfügt über ein 8K-Token-Kontextfenster, 4x größer als zuvor, und verarbeitet bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videobilder. Es zeigt eine Verbesserung um 9,92 Punkte bei der Code-Leistung, von 68,76 auf 78,68 in MTEB Code.
Embedding Gemma 2 ermöglicht vollständig On-Device semantische Suche, Routing und Abruf, gewährleistet Datenschutz und niedrige Latenz. Es kombiniert sich mit generativen Modellen wie Gemma 4 für On-Device-RAG-Pipelines und teilt Tokenizer und Audio-Encoder für eine einheitliche Pipeline mit geringerem Speicherverbrauch.
Was ist Embedding Gemma 2?
Embedding Gemma 2 ist ein leichtes multimodales Einbettungsmodell von Google DeepMind, das Text, Bilder, Audio und Video in einen einheitlichen Embedding-Raum abbildet, optimiert für On-Device-Inferenz mit 740M Parametern.
🇪🇸 Español
Embedding Gemma 2: Modelo multimodal en dispositivo
Embedding Gemma 2 es el modelo más capaz para incrustaciones multimodales en dispositivo, mapeando de forma nativa texto, imágenes, audio y video en un espacio de incrustación unificado. Introducido por Google DeepMind, expande el Embedding Gemma original, que tuvo más de 20 millones de descargas. Construido sobre la arquitectura Gemma 4 bajo licencia Apache 2.0, tiene 740 millones de parámetros, optimizado para inferencia en dispositivo.
Logra puntuaciones líderes entre incrustadores multimodales sub-1B en benchmarks como MTEB Code y MAEB, igualando o superando modelos más grandes. El diseño modular requiere tan solo 270M parámetros para tareas solo de texto, con codificadores opcionales de visión y audio. Usando Matryoshka Representation Learning, los vectores de salida pueden truncarse de 768 a 128 dimensiones, reduciendo el almacenamiento hasta 6 veces.
Optimizado para hardware de borde, funciona con tan solo ~191MB de RAM activa en un Google Pixel 11 Pro para solo texto, y ~567MB para el modelo multimodal completo. Cuenta con una ventana de contexto de 8K tokens, 4 veces más grande que antes, procesando hasta 5.5 minutos de audio, 29 imágenes o 58 fotogramas de video. Muestra una mejora de 9.92 puntos en rendimiento de código, de 68.76 a 78.68 en MTEB Code.
Embedding Gemma 2 permite búsqueda semántica, enrutamiento y recuperación completamente en dispositivo, garantizando privacidad de datos y baja latencia. Se combina con modelos generativos como Gemma 4 para pipelines RAG en dispositivo, compartiendo tokenizador y codificador de audio para un pipeline unificado con menor huella de memoria.
¿Qué es Embedding Gemma 2?
Embedding Gemma 2 es un modelo de incrustación multimodal ligero de Google DeepMind que mapea texto, imágenes, audio y video en un espacio de incrustación unificado, optimizado para inferencia en dispositivo con 740M parámetros.
🇫🇷 Français
Embedding Gemma 2 : Modèle multimodal sur appareil
Embedding Gemma 2 est le modèle le plus performant pour les embeddings multimodaux sur appareil, mappant nativement le texte, les images, l'audio et la vidéo dans un espace d'embedding unifié. Introduit par Google DeepMind, il étend l'Embedding Gemma original, qui a connu plus de 20 millions de téléchargements. Construit sur l'architecture Gemma 4 sous licence Apache 2.0, il possède 740 millions de paramètres, optimisé pour l'inférence sur appareil.
Il obtient des scores de premier plan parmi les embedders multimodaux sub-1B sur des benchmarks comme MTEB Code et MAEB, égalant ou surpassant des modèles plus grands. La conception modulaire nécessite aussi peu que 270M paramètres pour les tâches textuelles uniquement, avec des encodeurs optionnels pour la vision et l'audio. Grâce à Matryoshka Representation Learning, les vecteurs de sortie peuvent être tronqués de 768 à 128 dimensions, réduisant le stockage jusqu'à 6 fois.
Optimisé pour le matériel périphérique, il fonctionne avec aussi peu que ~191 Mo de RAM active sur un Google Pixel 11 Pro pour le texte seul, et ~567 Mo pour le modèle multimodal complet. Il dispose d'une fenêtre de contexte de 8K tokens, 4 fois plus grande qu'avant, traitant jusqu'à 5,5 minutes d'audio, 29 images ou 58 images vidéo. Il montre une amélioration de 9,92 points sur les performances de code, passant de 68,76 à 78,68 dans MTEB Code.
Embedding Gemma 2 permet la recherche sémantique, le routage et la récupération entièrement sur appareil, garantissant la confidentialité des données et une faible latence. Il s'associe à des modèles génératifs comme Gemma 4 pour des pipelines RAG sur appareil, partageant le tokenizer et l'encodeur audio pour un pipeline unifié avec une empreinte mémoire réduite.
Qu'est-ce qu'Embedding Gemma 2 ?
Embedding Gemma 2 est un modèle d'embedding multimodal léger de Google DeepMind qui mappe le texte, les images, l'audio et la vidéo dans un espace d'embedding unifié, optimisé pour l'inférence sur appareil avec 740M paramètres.
🇮🇳 हिन्दी
एम्बेडिंग जेम्मा 2: मल्टीमॉडल ऑन-डिवाइस मॉडल
एम्बेडिंग जेम्मा 2 ऑन-डिवाइस मल्टीमॉडल एम्बेडिंग के लिए सबसे सक्षम मॉडल है, जो टेक्स्ट, इमेज, ऑडियो और वीडियो को मूल रूप से एकीकृत एम्बेडिंग स्पेस में मैप करता है। Google DeepMind द्वारा पेश किया गया, यह मूल एम्बेडिंग जेम्मा पर विस्तार करता है, जिसे 20 मिलियन से अधिक डाउनलोड मिले। Gemma 4 आर्किटेक्चर पर Apache 2.0 लाइसेंस के तहत निर्मित, इसमें 740 मिलियन पैरामीटर हैं, जो ऑन-डिवाइस इन्फ्रेंस के लिए अनुकूलित है।
यह MTEB Code और MAEB जैसे बेंचमार्क पर sub-1B मल्टीमॉडल एम्बेडर्स के बीच अग्रणी स्कोर प्राप्त करता है, बड़े मॉडलों से मेल खाता है या उनसे बेहतर प्रदर्शन करता है। मॉड्यूलर डिज़ाइन के लिए टेक्स्ट-ओनली कार्यों के लिए केवल 270M पैरामीटर की आवश्यकता होती है, वैकल्पिक विज़न और ऑडियो एन्कोडर के साथ। Matryoshka Representation Learning का उपयोग करके, आउटपुट वैक्टर को 768 आयामों से 128 आयामों तक छोटा किया जा सकता है, जिससे स्टोरेज में 6 गुना तक की कमी आती है।
एज हार्डवेयर के लिए अनुकूलित, यह Google Pixel 11 Pro पर टेक्स्ट-ओनली के लिए ~191MB सक्रिय RAM और पूर्ण मल्टीमॉडल मॉडल के लिए ~567MB के साथ चलता है। इसमें 8K टोकन कॉन्टेक्स्ट विंडो है, जो पहले से 4 गुना बड़ी है, जो 5.5 मिनट के ऑडियो, 29 इमेज या 58 वीडियो फ्रेम तक प्रोसेस करती है। यह MTEB Code में 68.76 से 78.68 तक कोड प्रदर्शन में 9.92-पॉइंट सुधार दिखाता है।
एम्बेडिंग जेम्मा 2 पूरी तरह से ऑन-डिवाइस सिमेंटिक सर्च, रूटिंग और रिट्रीवल को सक्षम बनाता है, डेटा प्राइवेसी और कम लेटेंसी सुनिश्चित करता है। यह ऑन-डिवाइस RAG पाइपलाइनों के लिए Gemma 4 जैसे जनरेटिव मॉडल के साथ जोड़ा जाता है, कम मेमोरी फुटप्रिंट के साथ एकीकृत पाइपलाइन के लिए टोकनाइज़र और ऑडियो एन्कोडर साझा करता है।
एम्बेडिंग जेम्मा 2 क्या है?
एम्बेडिंग जेम्मा 2 Google DeepMind का एक हल्का मल्टीमॉडल एम्बेडिंग मॉडल है जो टेक्स्ट, इमेज, ऑडियो और वीडियो को एकीकृत एम्बेडिंग स्पेस में मैप करता है, 740M पैरामीटर के साथ ऑन-डिवाइस इन्फ्रेंस के लिए अनुकूलित।
🇮🇩 Bahasa Indonesia
Embedding Gemma 2: Model Multimodal pada Perangkat
Embedding Gemma 2 adalah model paling mumpuni untuk embedding multimodal pada perangkat, yang secara native memetakan teks, gambar, audio, dan video ke dalam ruang embedding terpadu. Diperkenalkan oleh Google DeepMind, model ini memperluas Embedding Gemma asli yang telah diunduh lebih dari 20 juta kali. Dibangun di atas arsitektur Gemma 4 di bawah lisensi Apache 2.0, model ini memiliki 740 juta parameter, dioptimalkan untuk inferensi pada perangkat.
Model ini mencapai skor terdepan di antara embedder multimodal sub-1B pada tolok ukur seperti MTEB Code dan MAEB, menyamai atau melampaui model yang lebih besar. Desain modular hanya membutuhkan 270M parameter untuk tugas teks saja, dengan encoder visi dan audio opsional. Menggunakan Matryoshka Representation Learning, vektor keluaran dapat dipotong dari 768 dimensi menjadi 128 dimensi, mengurangi penyimpanan hingga 6 kali lipat.
Dioptimalkan untuk perangkat edge, model ini berjalan dengan hanya ~191MB RAM aktif pada Google Pixel 11 Pro untuk teks saja, dan ~567MB untuk model multimodal penuh. Model ini memiliki jendela konteks 8K token, 4 kali lebih besar dari sebelumnya, memproses hingga 5,5 menit audio, 29 gambar, atau 58 bingkai video. Model ini menunjukkan peningkatan 9,92 poin pada kinerja kode, dari 68,76 menjadi 78,68 di MTEB Code.
Embedding Gemma 2 memungkinkan pencarian semantik, perutean, dan pengambilan sepenuhnya pada perangkat, memastikan privasi data dan latensi rendah. Model ini berpasangan dengan model generatif seperti Gemma 4 untuk pipeline RAG pada perangkat, berbagi tokenizer dan encoder audio untuk pipeline terpadu dengan jejak memori yang lebih rendah.
Apa itu Embedding Gemma 2?
Embedding Gemma 2 adalah model embedding multimodal ringan dari Google DeepMind yang memetakan teks, gambar, audio, dan video ke dalam ruang embedding terpadu, dioptimalkan untuk inferensi pada perangkat dengan 740M parameter.
🇯🇵 日本語
Embedding Gemma 2: マルチモーダルオンデバイスモデル
Embedding Gemma 2は、オンデバイスマルチモーダル埋め込みにおいて最も高性能なモデルであり、テキスト、画像、音声、動画をネイティブに統合埋め込み空間にマッピングします。Google DeepMindによって導入され、元のEmbedding Gemmaを拡張したもので、2000万回以上ダウンロードされました。Gemma 4アーキテクチャに基づき、Apache 2.0ライセンスの下で構築され、7億4000万パラメータを持ち、オンデバイス推論に最適化されています。
MTEB CodeやMAEBなどのベンチマークで、サブ1Bマルチモーダル埋め込みモデルの中でトップスコアを達成し、より大きなモデルに匹敵またはそれを上回ります。モジュラーデザインにより、テキストのみのタスクにはわずか2億7000万パラメータが必要で、オプションのビジョンおよびオーディオエンコーダを備えています。Matryoshka Representation Learningを使用することで、出力ベクトルを768次元から128次元に切り詰め、ストレージを最大6倍削減できます。
エッジハードウェア向けに最適化されており、Google Pixel 11 Proではテキストのみで約191MBのアクティブRAM、フルマルチモーダルモデルで約567MBで動作します。8Kトークンのコンテキストウィンドウを備え、以前の4倍のサイズで、最大5.5分の音声、29枚の画像、または58のビデオフレームを処理します。コードパフォーマンスでは、MTEB Codeで68.76から78.68へと9.92ポイントの改善を示しています。
Embedding Gemma 2は、完全にオンデバイスでのセマンティック検索、ルーティング、検索を可能にし、データプライバシーと低レイテンシを保証します。Gemma 4などの生成モデルと組み合わせてオンデバイスRAGパイプラインを実現し、トークナイザーとオーディオエンコーダを共有することで、統一されたパイプラインと低メモリフットプリントを実現します。
Embedding Gemma 2とは何ですか?
Embedding Gemma 2は、Google DeepMindによる軽量マルチモーダル埋め込みモデルで、テキスト、画像、音声、動画を統合埋め込み空間にマッピングし、7億4000万パラメータでオンデバイス推論に最適化されています。
🇧🇷 Português
Embedding Gemma 2: Modelo multimodal em dispositivo
Embedding Gemma 2 é o modelo mais capaz para incorporações multimodais em dispositivo, mapeando nativamente texto, imagens, áudio e vídeo em um espaço de incorporação unificado. Introduzido pelo Google DeepMind, ele expande o Embedding Gemma original, que teve mais de 20 milhões de downloads. Construído na arquitetura Gemma 4 sob licença Apache 2.0, possui 740 milhões de parâmetros, otimizado para inferência em dispositivo.
Ele alcança pontuações líderes entre incorporadores multimodais sub-1B em benchmarks como MTEB Code e MAEB, igualando ou superando modelos maiores. O design modular requer apenas 270M parâmetros para tarefas somente de texto, com codificadores opcionais de visão e áudio. Usando Matryoshka Representation Learning, os vetores de saída podem ser truncados de 768 para 128 dimensões, reduzindo o armazenamento em até 6 vezes.
Otimizado para hardware de borda, ele funciona com apenas ~191MB de RAM ativa em um Google Pixel 11 Pro para texto, e ~567MB para o modelo multimodal completo. Ele possui uma janela de contexto de 8K tokens, 4 vezes maior que antes, processando até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo. Ele mostra uma melhoria de 9,92 pontos no desempenho de código, de 68,76 para 78,68 no MTEB Code.
Embedding Gemma 2 permite pesquisa semântica, roteamento e recuperação totalmente em dispositivo, garantindo privacidade de dados e baixa latência. Ele combina com modelos generativos como Gemma 4 para pipelines RAG em dispositivo, compartilhando tokenizador e codificador de áudio para um pipeline unificado com menor pegada de memória.
O que é Embedding Gemma 2?
Embedding Gemma 2 é um modelo de incorporação multimodal leve do Google DeepMind que mapeia texto, imagens, áudio e vídeo em um espaço de incorporação unificado, otimizado para inferência em dispositivo com 740M parâmetros.
🇷🇺 Русский
Embedding Gemma 2: Мультимодальная модель на устройстве
Embedding Gemma 2 — это самая производительная модель для мультимодальных встраиваний на устройстве, которая нативно отображает текст, изображения, аудио и видео в единое пространство встраивания. Представленная Google DeepMind, она расширяет оригинальную Embedding Gemma, которая получила более 20 миллионов загрузок. Построенная на архитектуре Gemma 4 под лицензией Apache 2.0, она имеет 740 миллионов параметров, оптимизированных для вывода на устройстве.
Она достигает ведущих показателей среди мультимодальных встраивателей sub-1B в таких бенчмарках, как MTEB Code и MAEB, сравниваясь или превосходя более крупные модели. Модульная конструкция требует всего 270M параметров для задач только с текстом, с опциональными кодировщиками зрения и аудио. Используя Matryoshka Representation Learning, выходные векторы можно усекать с 768 до 128 измерений, сокращая хранилище до 6 раз.
Оптимизированная для периферийного оборудования, она работает всего с ~191 МБ активной оперативной памяти на Google Pixel 11 Pro для текста и ~567 МБ для полной мультимодальной модели. Она имеет окно контекста в 8K токенов, в 4 раза больше прежнего, обрабатывая до 5,5 минут аудио, 29 изображений или 58 видеокадров. Она показывает улучшение на 9,92 балла в производительности кода, с 68,76 до 78,68 в MTEB Code.
Embedding Gemma 2 обеспечивает полностью локальный семантический поиск, маршрутизацию и извлечение, гарантируя конфиденциальность данных и низкую задержку. Она сочетается с генеративными моделями, такими как Gemma 4, для локальных конвейеров RAG, разделяя токенизатор и аудиокодировщик для единого конвейера с меньшим потреблением памяти.
Что такое Embedding Gemma 2?
Embedding Gemma 2 — это легкая мультимодальная модель встраивания от Google DeepMind, которая отображает текст, изображения, аудио и видео в единое пространство встраивания, оптимизированное для вывода на устройстве с 740M параметров.
🇨🇳 简体中文
Embedding Gemma 2:多模态设备端模型
Embedding Gemma 2是设备端多模态嵌入中最强大的模型,能够将文本、图像、音频和视频原生映射到统一的嵌入空间。由Google DeepMind推出,它在原始Embedding Gemma的基础上进行了扩展,后者获得了超过2000万次下载。基于Gemma 4架构构建,采用Apache 2.0许可证,拥有7.4亿参数,针对设备端推理进行了优化。
它在MTEB Code和MAEB等基准测试中,在低于1B参数的多模态嵌入模型中取得了领先分数,匹配或超越了更大的模型。模块化设计仅需2.7亿参数即可处理纯文本任务,并可选配视觉和音频编码器。利用Matryoshka表示学习,输出向量可以从768维截断至128维,存储空间最多减少6倍。
针对边缘硬件优化,在Google Pixel 11 Pro上,纯文本模式仅需约191MB活跃RAM,完整多模态模式约需567MB。它拥有8K令牌上下文窗口,比之前大4倍,可处理长达5.5分钟的音频、29张图像或58个视频帧。代码性能提升了9.92分,在MTEB Code中从68.76提升至78.68。
Embedding Gemma 2支持完全设备端的语义搜索、路由和检索,确保数据隐私和低延迟。它与Gemma 4等生成模型配对,用于设备端RAG流水线,共享分词器和音频编码器,实现统一流水线并降低内存占用。
什么是Embedding Gemma 2?
Embedding Gemma 2是Google DeepMind推出的轻量级多模态嵌入模型,将文本、图像、音频和视频映射到统一的嵌入空间,针对设备端推理进行了优化,拥有7.4亿参数。