Embedding Gemma 2 es el modelo más capaz para incrustaciones multimodales en dispositivo, mapeando de forma nativa texto, imágenes, audio y video en un espacio de incrustación unificado. Introducido por Google DeepMind, expande el Embedding Gemma original, que tuvo más de 20 millones de descargas. Construido sobre la arquitectura Gemma 4 bajo licencia Apache 2.0, tiene 740 millones de parámetros, optimizado para inferencia en dispositivo.
Logra puntuaciones líderes entre incrustadores multimodales sub-1B en benchmarks como MTEB Code y MAEB, igualando o superando modelos más grandes. El diseño modular requiere tan solo 270M parámetros para tareas solo de texto, con codificadores opcionales de visión y audio. Usando Matryoshka Representation Learning, los vectores de salida pueden truncarse de 768 a 128 dimensiones, reduciendo el almacenamiento hasta 6 veces.
Optimizado para hardware de borde, funciona con tan solo ~191MB de RAM activa en un Google Pixel 11 Pro para solo texto, y ~567MB para el modelo multimodal completo. Cuenta con una ventana de contexto de 8K tokens, 4 veces más grande que antes, procesando hasta 5.5 minutos de audio, 29 imágenes o 58 fotogramas de video. Muestra una mejora de 9.92 puntos en rendimiento de código, de 68.76 a 78.68 en MTEB Code.
Embedding Gemma 2 permite búsqueda semántica, enrutamiento y recuperación completamente en dispositivo, garantizando privacidad de datos y baja latencia. Se combina con modelos generativos como Gemma 4 para pipelines RAG en dispositivo, compartiendo tokenizador y codificador de audio para un pipeline unificado con menor huella de memoria.
Fuente: Hacker News · Resumido por HeadlinesBriefing