Embedding Gemma 2 est le modèle le plus performant pour les embeddings multimodaux sur appareil, mappant nativement le texte, les images, l'audio et la vidéo dans un espace d'embedding unifié. Introduit par Google DeepMind, il étend l'Embedding Gemma original, qui a connu plus de 20 millions de téléchargements. Construit sur l'architecture Gemma 4 sous licence Apache 2.0, il possède 740 millions de paramètres, optimisé pour l'inférence sur appareil.
Il obtient des scores de premier plan parmi les embedders multimodaux sub-1B sur des benchmarks comme MTEB Code et MAEB, égalant ou surpassant des modèles plus grands. La conception modulaire nécessite aussi peu que 270M paramètres pour les tâches textuelles uniquement, avec des encodeurs optionnels pour la vision et l'audio. Grâce à Matryoshka Representation Learning, les vecteurs de sortie peuvent être tronqués de 768 à 128 dimensions, réduisant le stockage jusqu'à 6 fois.
Optimisé pour le matériel périphérique, il fonctionne avec aussi peu que ~191 Mo de RAM active sur un Google Pixel 11 Pro pour le texte seul, et ~567 Mo pour le modèle multimodal complet. Il dispose d'une fenêtre de contexte de 8K tokens, 4 fois plus grande qu'avant, traitant jusqu'à 5,5 minutes d'audio, 29 images ou 58 images vidéo. Il montre une amélioration de 9,92 points sur les performances de code, passant de 68,76 à 78,68 dans MTEB Code.
Embedding Gemma 2 permet la recherche sémantique, le routage et la récupération entièrement sur appareil, garantissant la confidentialité des données et une faible latence. Il s'associe à des modèles génératifs comme Gemma 4 pour des pipelines RAG sur appareil, partageant le tokenizer et l'encodeur audio pour un pipeline unifié avec une empreinte mémoire réduite.
Source: Hacker News · Résumé par HeadlinesBriefing