HeadlinesBriefing HeadlinesBriefing.com

Embedding Gemma 2:多模态设备端模型

Hacker News •
×

Embedding Gemma 2是设备端多模态嵌入中最强大的模型,能够将文本、图像、音频和视频原生映射到统一的嵌入空间。由Google DeepMind推出,它在原始Embedding Gemma的基础上进行了扩展,后者获得了超过2000万次下载。基于Gemma 4架构构建,采用Apache 2.0许可证,拥有7.4亿参数,针对设备端推理进行了优化。

它在MTEB Code和MAEB等基准测试中,在低于1B参数的多模态嵌入模型中取得了领先分数,匹配或超越了更大的模型。模块化设计仅需2.7亿参数即可处理纯文本任务,并可选配视觉和音频编码器。利用Matryoshka表示学习,输出向量可以从768维截断至128维,存储空间最多减少6倍。

针对边缘硬件优化,在Google Pixel 11 Pro上,纯文本模式仅需约191MB活跃RAM,完整多模态模式约需567MB。它拥有8K令牌上下文窗口,比之前大4倍,可处理长达5.5分钟的音频、29张图像或58个视频帧。代码性能提升了9.92分,在MTEB Code中从68.76提升至78.68。

Embedding Gemma 2支持完全设备端的语义搜索、路由和检索,确保数据隐私和低延迟。它与Gemma 4等生成模型配对,用于设备端RAG流水线,共享分词器和音频编码器,实现统一流水线并降低内存占用。

来源: Hacker News · 由HeadlinesBriefing整理摘要