HeadlinesBriefing favicon HeadlinesBriefing.com

لماذا تنفد ذاكرة VRAM في خوادم استنتاج نماذج اللغة الكبيرة

Towards Data Science •
×

تتناسب أوزان نموذج متوسط الحجم بشكل مريح، لكن حركة المرور المتزامنة أثارت أخطاء CUDA نفاد الذاكرة بينما bleef استخدام GPU منخفضًا. ذاكرة التخزين المؤقت للمفتاح-القيمة، وليس حجم النموذج، استهلكت المساحة المتاحة. قبل إضافة وحدة معالجة رسومات، قام المؤلف بتمكين التخصيص الصفحي وتخزين المؤقت للمقدمات، مما رفع السعر وكشف عن مشكلة في تخطيط الذاكرة.

تحجز أكوام الخدمة الساذجة كتلة متجاورة لكل طلب للطول الأقصى للتسلسل. طلب ينتج 200 رمزًا مقابل حجز 4,096 رمزًا يترك معظمه غير مستخدم. وجد تحليل v LLM أن إدارة ذاكرة التخزين المؤقت KV الساذجة تهدر من 60 إلى 80 بالمائة من الذاكرة المحجوزة. يزداد ذاكرة التخزين المؤقت مع الطلبات المتزامنة، لذا فإن ذروات المرور — وليس المطالبات الأطول — تدفع الخوادم إلى ما وراء حافة الذاكرة.

تُشارك ذاكرة GPU بين أوزان النموذج الثابتة، والتفعيلات العابرة، وذاكرة التخزين المؤقت KV المتغيرة. يكلف كل رمز تقريبًا 320 كيلوبايت لنموذج Llama 3.1 70B بـ BF16، مع 80 طبقة، و8 رؤوس مفتاح/قيمة، وبُعد رأس 128. تقلل الانتباه grouped-query عدد رؤوس المفتاح/القيمة وحجم ذاكرة التخزين المؤقت.

مع 128 طلبًا متزامنًا تحتفظ بسياقات بطول 4K رمزًا، تحتاج ذاكرة التخزين المؤقت وحدها إلى حوالي 160 جيجابايت. تحتاج أوزان 70B إلى 140 جيجابايت بـ BF16، لذا يمكن لذاكرة التخزين المؤقت أن تتجاوز النموذج. يحجز v LLM ذاكرة التخزين المؤقت كحد أقصى للتسلسلات المتزامنة مضروبًا في أقصى طول للتسلسل؛ فإن زيادة أي منهما يضرب الحجز ويمكن أن يتسبب في OOM عند البدء.

الكيانات الرئيسية: الشركات: NVIDIA, Towards Data Science

الأسئلة الشائعة: لماذا يمكن لخادم الاستنتاج أن يعيد أخطاء CUDA نفاد الذاكرة بينما يبقى استخدام حساب GPU منخفضًا؟

لأن ذاكرة التخزين المؤقت KV تنمو مع الطلبات المتزامنة وطول التسلسل. قد تناسب الأوزان، لكن الذاكرة المؤقتة المخصصة مسبقًا يمكن أن تستهلك VRAM المتبقية قبل أن يصل GPU إلى تشبع الحساب.

الأسئلة الشائعة س: لماذا يمكن لخادم الاستنتاج أن يعيد أخطاء CUDA نفاد الذاكرة بينما يبقى استخدام حساب GPU منخفضًا؟

الأسئلة الشائعة ج: لأن ذاكرة التخزين المؤقت KV تنمو مع الطلبات المتزامنة وطول التسلسل. قد تناسب الأوزان، لكن الذاكرة المؤقتة المخصصة مسبقًا يمكن أن تستهلك VRAM المتبقية قبل أن يصل GPU إلى تشبع الحساب。