HeadlinesBriefing HeadlinesBriefing.com

Embedding Gemma 2: マルチモーダルオンデバイスモデル

Hacker News •
×

Embedding Gemma 2は、オンデバイスマルチモーダル埋め込みにおいて最も高性能なモデルであり、テキスト、画像、音声、動画をネイティブに統合埋め込み空間にマッピングします。Google DeepMindによって導入され、元のEmbedding Gemmaを拡張したもので、2000万回以上ダウンロードされました。Gemma 4アーキテクチャに基づき、Apache 2.0ライセンスの下で構築され、7億4000万パラメータを持ち、オンデバイス推論に最適化されています。

MTEB CodeやMAEBなどのベンチマークで、サブ1Bマルチモーダル埋め込みモデルの中でトップスコアを達成し、より大きなモデルに匹敵またはそれを上回ります。モジュラーデザインにより、テキストのみのタスクにはわずか2億7000万パラメータが必要で、オプションのビジョンおよびオーディオエンコーダを備えています。Matryoshka Representation Learningを使用することで、出力ベクトルを768次元から128次元に切り詰め、ストレージを最大6倍削減できます。

エッジハードウェア向けに最適化されており、Google Pixel 11 Proではテキストのみで約191MBのアクティブRAM、フルマルチモーダルモデルで約567MBで動作します。8Kトークンのコンテキストウィンドウを備え、以前の4倍のサイズで、最大5.5分の音声、29枚の画像、または58のビデオフレームを処理します。コードパフォーマンスでは、MTEB Codeで68.76から78.68へと9.92ポイントの改善を示しています。

Embedding Gemma 2は、完全にオンデバイスでのセマンティック検索、ルーティング、検索を可能にし、データプライバシーと低レイテンシを保証します。Gemma 4などの生成モデルと組み合わせてオンデバイスRAGパイプラインを実現し、トークナイザーとオーディオエンコーダを共有することで、統一されたパイプラインと低メモリフットプリントを実現します。

出典: Hacker News · 要約:HeadlinesBriefing