HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0: تحديثات أداء ومنصة رئيسية

Hacker News •
×

يقدم إصدار v0.28.0 لمشروع vLLM مفتوح المصدر 584 التزاماً من 270 مساهماً، مما يشكل دفعة أداء كبيرة لـ Kimi-K3. تشمل التحسينات الرئيسية دعم Decode Context Parallel (DCP) والنواة Flash KDA المدمجة، مما يوفر تسريعاً على مستوى النواة بين 1.5x و3x من خلال all-gathers مدمجة. يضيف الإصدار دعماً لـ sparse MLA لـ DeepSeek V4، مما يتيح فك التشفير من الطرف إلى الطرف والتخميني، إلى جانب دعم AMD Quark NVFP4. تتقدم التقنيات في التخميني مع DFlash2 وDSpark التحقق المجدول على أساس الثقة. تتميز نضج Model Runner V2 بـ disaggregation E/P/D وإخراج الأوزان. الإعدادات الافتراضية الجديدة ترفع الحد الأقصى لرموز الدفعة إلى 16384 وتمكّن تخزين بيانات التخزين المؤقت للبادئة لنماذج Mamba. تشمل التغييرات المُعَدَّة نقل bitsandbytes إلى ملحق خارج الشجرة وتحديث Transformers إلى 5.15.0. تشمل منتجات الإصدار عجلات Python لـ CUDA 13.0 وROCm، بالإضافة إلى صور Docker عبر منصات متعددة. يشمل دعم النماذج الجديدة تحسينات Muse Glimmer وLing 3.0 وQwen3.5. يثبت هذا التحديث مكانة vLLM كإطار رائد لخدمة نماذج اللغة الكبيرة.