HeadlinesBriefing favicon HeadlinesBriefing.com

كسر حاجز 1.58 بت لنماذج LLM الثلاثية

Hacker News •
×

تخزن نماذج اللغة الكبيرة (LLM) الثلاثية كل وزن كأحد ثلاثة رموز {-1,0,+1}، لذا فإن تكلفة النموذج الثلاثي تُشار إليها تقليديا بـ log₂ 3 ≈ 1.585 بت لكل وزن من نظرية المعلومات. تضع صيغة النشر السائدة خمسة أوزان ثلاثية في بايت واحد (تعبئة الخمسة ثلاثيات)، وبسبب أحجام المجموعات من قوى الاثنين المستخدمة عمليا، يتم تقريب هذا إلى 1.625 بت لكل وزن.

يعامل عرض البت التخزيني الفعال هذا الرموز الثلاثة كمتساوية الاحتمال. قمنا بقياس توزيع الرموز الفعلي لـ 29 نموذجا من نماذج LLM الثلاثية ووجدنا أن الأصفار تشكل ما يصل إلى 51.5% من جميع الأوزان. بدافع من هذا الاكتشاف، نقدم BITCOS، وهو تخطيط بسيط متكيف مع التوزيع يتكون من خريطة بتات وجود كثيفة بالإضافة إلى متجه إشارة مضغوط، ويكلف 2 - z بت لكل عنصر وزن بالنظر إلى كثافة صفرية z في أوزان النموذج.

يخزن BITCOS الأوزان بشكل أكثر إحكاما من تعبئة الخمسة ثلاثيات في 26 من أصل 29 نموذجا تم اختبارها، ويصل إلى 1.485 بت لكل وزن في أكثرها تناثرا. BITCOS قابل لفك التعبئة بكفاءة على المعالجات الحديثة ووحدات GPU، ونقدم تسلسلات فك تعبئة محسنة لـ AVX-512 وAVX2 ووحدات Intel Xe2 GPU.

عند القياس مقابل نوى ضرب المصفوفة-المتجه الثلاثية الأحدث في الإنتاج، عند كثافات الأصفار التي تظهرها نماذج ثلاثية في العالم الحقيقي، تصل المكاسب المحققة مع تخطيطنا المقترح إلى 1.28×. أخيرا، نوضح نتائج استدلال LLM من البداية إلى النهاية على 5 منصات مختلفة حيث تتحسن إنتاجية فك التشفير بما يصل إلى 1.18× على وحدات CPU و1.27× على وحدات GPU.

الكيانات الرئيسية: الشركات: Intel | الأشخاص: Evangelos Georganas