Embedding Gemma 2 adalah model paling mumpuni untuk embedding multimodal pada perangkat, yang secara native memetakan teks, gambar, audio, dan video ke dalam ruang embedding terpadu. Diperkenalkan oleh Google DeepMind, model ini memperluas Embedding Gemma asli yang telah diunduh lebih dari 20 juta kali. Dibangun di atas arsitektur Gemma 4 di bawah lisensi Apache 2.0, model ini memiliki 740 juta parameter, dioptimalkan untuk inferensi pada perangkat.
Model ini mencapai skor terdepan di antara embedder multimodal sub-1B pada tolok ukur seperti MTEB Code dan MAEB, menyamai atau melampaui model yang lebih besar. Desain modular hanya membutuhkan 270M parameter untuk tugas teks saja, dengan encoder visi dan audio opsional. Menggunakan Matryoshka Representation Learning, vektor keluaran dapat dipotong dari 768 dimensi menjadi 128 dimensi, mengurangi penyimpanan hingga 6 kali lipat.
Dioptimalkan untuk perangkat edge, model ini berjalan dengan hanya ~191MB RAM aktif pada Google Pixel 11 Pro untuk teks saja, dan ~567MB untuk model multimodal penuh. Model ini memiliki jendela konteks 8K token, 4 kali lebih besar dari sebelumnya, memproses hingga 5,5 menit audio, 29 gambar, atau 58 bingkai video. Model ini menunjukkan peningkatan 9,92 poin pada kinerja kode, dari 68,76 menjadi 78,68 di MTEB Code.
Embedding Gemma 2 memungkinkan pencarian semantik, perutean, dan pengambilan sepenuhnya pada perangkat, memastikan privasi data dan latensi rendah. Model ini berpasangan dengan model generatif seperti Gemma 4 untuk pipeline RAG pada perangkat, berbagi tokenizer dan encoder audio untuk pipeline terpadu dengan jejak memori yang lebih rendah.
Sumber: Hacker News · Diringkas oleh HeadlinesBriefing