HeadlinesBriefing favicon HeadlinesBriefing.com

التفكيك مشكلة 1000 GPU: متى يعمل

Towards Data Science •
×

أطلقت كل أطر الاستدلال الرئيسية تفكيك التعبئة المسبقة والفك هذا العام. قامت NVIDIA ببنائه في Dynamo. جعلته SGLang الافتراضي للنشر واسع النطاق. أضافت v LLM واجهة برمجة تطبيقات لموصل KV لدعمه أصليًا. يتشكل الإجماع بسرعة: قسّم التعبئة المسبقة والفك على مجموعات GPU منفصلة، ويتحسن الإنتاجية. هذا الإجماع خاطئ لمعظم الفرق. يظهر تحليل Doubleword أن النشر المفكك المتوازن يطابق الإنتاجية المشتركة، ولكن مع أعداد صغيرة من وحدات GPU تهيمن خسائر التقريب: لا يمكنك تخصيص وحدات GPU كسور، لذا تُلتهم مكاسب التخصص بسبب الاستخدام غير الكامل للعمال. الفائدة العملية على هذا النطاق هي ضبط SLO المستقل، وليس الإنتاجية. وجدت دراسة يونيو 2025 التي قيمت مئات الآلاف من نقاط التصميم أن التفكيك أكثر فعالية لأنماط حركة المرور الثقيلة بالتعبئة المسبقة والنماذج الأكبر. بالنسبة لأحمال العمل المختلطة التي تشغلها معظم الفرق فعليًا، سيطرت قائمة الانتظار ونقل ذاكرة التخزين المؤقت KV بين العقد على زمن الوصول من طرف إلى طرف. الفرق التي فككت نقلت عنق الزجاجة. لم تزله. واجهت هذا في حمل عمل استدلال يخدم نموذج تصنيف متوسط الحجم. ارتفع TPOT تحت حركة المرور المتدفقة، وكان الغريزة الأولى هي فصل التعبئة المسبقة عن الفك. بدلاً من ذلك، قمت بتمكين التعبئة المسبقة المقسمة على نفس مجموعة GPU. استقر TPOT. كانت المشكلة هي تداخل الجدولة، وتعاملت التعبئة المسبقة المقسمة معها دون إضافة قفزة شبكة. تقسم التعبئة المسبقة المقسمة طلبات التعبئة المسبقة الطويلة إلى أجزاء أصغر وتقحمها مع دفعات الفك على نفس وحدة GPU. لا مجموعات عقد منفصلة. لا نقل ذاكرة التخزين المؤقت KV عبر الشبكة. لا نسبة P:D لضبطها. قاست TNG Technology Consulting زيادة بنسبة 50 في المائة في إجمالي إنتاجية الرموز باستخدام v LLM القياسية مع تمكين التعبئة المسبقة المقسمة. لا تزال دفعات الفك تعمل بين أجزاء التعبئة المسبقة على نفس الأجهزة، لكن تداخل الجدولة انخفض إلى مستوى يمكن لمعظم أحمال عمل الإنتاج تحمله. بالنسبة لأحمال العمل التي تقل عن حوالي 50 طلبًا في الثانية بأطوال مطالبات معتدلة، فإن هذا الحد ضيق بما يكفي.