Embedding Gemma 2 é o modelo mais capaz para incorporações multimodais em dispositivo, mapeando nativamente texto, imagens, áudio e vídeo em um espaço de incorporação unificado. Introduzido pelo Google DeepMind, ele expande o Embedding Gemma original, que teve mais de 20 milhões de downloads. Construído na arquitetura Gemma 4 sob licença Apache 2.0, possui 740 milhões de parâmetros, otimizado para inferência em dispositivo.
Ele alcança pontuações líderes entre incorporadores multimodais sub-1B em benchmarks como MTEB Code e MAEB, igualando ou superando modelos maiores. O design modular requer apenas 270M parâmetros para tarefas somente de texto, com codificadores opcionais de visão e áudio. Usando Matryoshka Representation Learning, os vetores de saída podem ser truncados de 768 para 128 dimensões, reduzindo o armazenamento em até 6 vezes.
Otimizado para hardware de borda, ele funciona com apenas ~191MB de RAM ativa em um Google Pixel 11 Pro para texto, e ~567MB para o modelo multimodal completo. Ele possui uma janela de contexto de 8K tokens, 4 vezes maior que antes, processando até 5,5 minutos de áudio, 29 imagens ou 58 quadros de vídeo. Ele mostra uma melhoria de 9,92 pontos no desempenho de código, de 68,76 para 78,68 no MTEB Code.
Embedding Gemma 2 permite pesquisa semântica, roteamento e recuperação totalmente em dispositivo, garantindo privacidade de dados e baixa latência. Ele combina com modelos generativos como Gemma 4 para pipelines RAG em dispositivo, compartilhando tokenizador e codificador de áudio para um pipeline unificado com menor pegada de memória.
Fonte: Hacker News · Resumido por HeadlinesBriefing