HeadlinesBriefing favicon HeadlinesBriefing.com

Bonsai 2 27B: أصغر 9 مرات، بقدرة 98.2%

Hacker News •
×

قبل شهرين، أصدرنا أول نماذج Bonsai 27B وأظهرنا أن نموذجًا متعدد الوسائط من فئة 27B يمكن ضغطه بما يكفي ليعمل بكفاءة على جهاز محلي. اليوم، نطلق Ternary Bonsai 2 27B، أقدر نموذج لدينا حتى الآن. استنادًا إلى Qwen3.8 27B، فإنه يجلب استدلالًا وبرمجة ورؤية وقدرة وكيلية أقوى مع الحفاظ على بصمة ذاكرة أصغر بشكل كبير، وإنتاجية محلية عالية، وكفاءة طاقة أفضل.

يستخدم Ternary Bonsai 2 27B أوزانًا ثلاثية {−1, 0, +1} مع تحجيم جماعي بـFP16، لـ1.76 بت فعال لكل وزن وبصمة نموذج إجمالية تبلغ 5.9GB. يدعم نافذة سياق من 262K رمزًا، وإدخالًا متعدد الوسائط نصيًا وصوريًا، ويُصدر تحت ترخيص Apache 2.0. مقابل نظيره كامل الدقة، فهو أصغر بأكثر من 9 مرات مع الاحتفاظ بـ98.2% من أداء المعايير الإجمالي. عند هذا المستوى من الاحتفاظ، يصبح الضغط فتحًا للنشر: تقريبًا نفس القدرة، في بصمة يمكن تشغيلها في أماكن أكثر بكثير.

عبر مجموعة معايير تمتد على الاستدلال والرياضيات والبرمجة واتباع التعليمات والرؤية واستخدام الأدوات الوكيلية، يسجل Ternary Bonsai 2 27B 83.9، محتفظًا بـ98.2% من الأداء الإجمالي لـQwen3.8 27B. النتيجة الرئيسية ليست فقط الدرجة الإجمالية، بل أين يتم الاحتفاظ بالقدرة. وكلاء البرمجة وأنظمة استخدام الأدوات وسير العمل متعدد الوسائط والمهام طويلة الأفق حساسة بشكل خاص لتدهور النموذج لأن الأخطاء الصغيرة يمكن أن تتراكم عبر خطوات عديدة. يحافظ Bonsai 2 27B على الكثير من أداء النموذج كامل الدقة في هذه المجالات تحديدًا بينما يعمل بجزء صغير من بصمة الذاكرة.

يصل Ternary Bonsai 2 27B إلى 143 رمزًا/ثانية على NVIDIA Ge Force RTX 5090 و46.8 رمزًا/ثانية على M5 Max. على RTX 4090، يستهلك فقط 0.714 m Wh/رمز، مما يجعله أكثر كفاءة في الطاقة بنسبة 40% من نموذج 8B يعمل بدقة كاملة.

الكيانات الرئيسية: الشركات: Qwen، NVIDIA، Cline