HeadlinesBriefing HeadlinesBriefing.com

Embedding Gemma 2: نموذج متعدد الوسائط على الجهاز

Hacker News •
×

Embedding Gemma 2 هو النموذج الأكثر قدرة على التضمين متعدد الوسائط على الجهاز، حيث يقوم بربط النصوص والصور والصوت والفيديو بشكل أصلي في فضاء تضمين موحد. تم تقديمه بواسطة Google DeepMind، وهو يوسع نطاق Embedding Gemma الأصلي الذي شهد أكثر من 20 مليون تنزيل. مبني على بنية Gemma 4 بموجب ترخيص Apache 2.0، ويمتلك 740 مليون معلمة، محسّن للاستدلال على الجهاز.

يحقق نتائج رائدة بين أدوات التضمين متعددة الوسائط التي تقل عن 1B معلمة في معايير مثل MTEB Code وMAEB، مما يضاهي أو يتفوق على النماذج الأكبر. يتطلب التصميم المعياري ما لا يقل عن 270M معلمة للمهام النصية فقط، مع مشفرات اختيارية للرؤية والصوت. باستخدام Matryoshka Representation Learning، يمكن تقليص متجهات الإخراج من 768 بُعدًا إلى 128 بُعدًا، مما يقلل التخزين بنسبة تصل إلى 6 مرات.

محسّن للأجهزة الطرفية، يعمل مع حوالي 191MB من ذاكرة الوصول العشوائي النشطة على Google Pixel 11 Pro للنص فقط، وحوالي 567MB للنموذج متعدد الوسائط الكامل. يتميز بنافذة سياق 8K رمز، أكبر 4 مرات من السابق، لمعالجة ما يصل إلى 5.5 دقيقة من الصوت، أو 29 صورة، أو 58 إطار فيديو. يُظهر تحسنًا بمقدار 9.92 نقطة في أداء الكود، من 68.76 إلى 78.68 في MTEB Code.

يتيح Embedding Gemma 2 البحث الدلالي والتوجيه والاسترجاع بالكامل على الجهاز، مما يضمن خصوصية البيانات وزمن انتقال منخفض. يتزاوج مع النماذج التوليدية مثل Gemma 4 لخطوط أنابيب RAG على الجهاز، ويشارك المُرمّز ومشفر الصوت لخط أنابيب موحد مع بصمة ذاكرة أقل.

المصدر: Hacker News · لخّصه HeadlinesBriefing