HeadlinesBriefing HeadlinesBriefing.com

Embedding Gemma 2: Мультимодальная модель на устройстве

Hacker News •
×

Embedding Gemma 2 — это самая производительная модель для мультимодальных встраиваний на устройстве, которая нативно отображает текст, изображения, аудио и видео в единое пространство встраивания. Представленная Google DeepMind, она расширяет оригинальную Embedding Gemma, которая получила более 20 миллионов загрузок. Построенная на архитектуре Gemma 4 под лицензией Apache 2.0, она имеет 740 миллионов параметров, оптимизированных для вывода на устройстве.

Она достигает ведущих показателей среди мультимодальных встраивателей sub-1B в таких бенчмарках, как MTEB Code и MAEB, сравниваясь или превосходя более крупные модели. Модульная конструкция требует всего 270M параметров для задач только с текстом, с опциональными кодировщиками зрения и аудио. Используя Matryoshka Representation Learning, выходные векторы можно усекать с 768 до 128 измерений, сокращая хранилище до 6 раз.

Оптимизированная для периферийного оборудования, она работает всего с ~191 МБ активной оперативной памяти на Google Pixel 11 Pro для текста и ~567 МБ для полной мультимодальной модели. Она имеет окно контекста в 8K токенов, в 4 раза больше прежнего, обрабатывая до 5,5 минут аудио, 29 изображений или 58 видеокадров. Она показывает улучшение на 9,92 балла в производительности кода, с 68,76 до 78,68 в MTEB Code.

Embedding Gemma 2 обеспечивает полностью локальный семантический поиск, маршрутизацию и извлечение, гарантируя конфиденциальность данных и низкую задержку. Она сочетается с генеративными моделями, такими как Gemma 4, для локальных конвейеров RAG, разделяя токенизатор и аудиокодировщик для единого конвейера с меньшим потреблением памяти.

Источник: Hacker News · Сводку подготовил HeadlinesBriefing