HeadlinesBriefing HeadlinesBriefing.com

Embedding Gemma 2: Multimodales On-Device-Modell

Hacker News •
×

Embedding Gemma 2 ist das leistungsfähigste Modell für multimodale On-Device-Embeddings, das Text, Bilder, Audio und Video nativ in einen einheitlichen Embedding-Raum abbildet. Eingeführt von Google DeepMind, erweitert es das ursprüngliche Embedding Gemma, das über 20 Millionen Downloads verzeichnete. Basierend auf der Gemma-4-Architektur unter einer Apache-2.0-Lizenz verfügt es über 740 Millionen Parameter, optimiert für On-Device-Inferenz.

Es erzielt führende Ergebnisse unter sub-1B multimodalen Embeddern in Benchmarks wie MTEB Code und MAEB und übertrifft oder erreicht größere Modelle. Das modulare Design erfordert nur 270M Parameter für reine Textaufgaben, mit optionalen Vision- und Audio-Encodern. Mittels Matryoshka Representation Learning können Ausgabevektoren von 768 auf 128 Dimensionen gekürzt werden, was den Speicher um bis zu 6x reduziert.

Optimiert für Edge-Hardware, läuft es mit nur ~191 MB aktivem RAM auf einem Google Pixel 11 Pro für Text und ~567 MB für das vollständige multimodale Modell. Es verfügt über ein 8K-Token-Kontextfenster, 4x größer als zuvor, und verarbeitet bis zu 5,5 Minuten Audio, 29 Bilder oder 58 Videobilder. Es zeigt eine Verbesserung um 9,92 Punkte bei der Code-Leistung, von 68,76 auf 78,68 in MTEB Code.

Embedding Gemma 2 ermöglicht vollständig On-Device semantische Suche, Routing und Abruf, gewährleistet Datenschutz und niedrige Latenz. Es kombiniert sich mit generativen Modellen wie Gemma 4 für On-Device-RAG-Pipelines und teilt Tokenizer und Audio-Encoder für eine einheitliche Pipeline mit geringerem Speicherverbrauch.

Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing