HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0: प्रमुख प्रदर्शन और प्लेटफ़ॉर्म अपडेट

Hacker News •
×

vLLM ओपन-सोर्स प्रोजेक्ट के v0.28.0 रिलीज़ में 270 योगदानकर्ताओं के 584 कमिट्स शामिल हैं, जो Kimi-K3 के लिए एक महत्वपूर्ण प्रदर्शन सुधार का संकेत देता है। प्रमुख अनुकूलनों में Decode Context Parallel (DCP) समर्थन और fused Flash KDA कर्नल शामिल हैं, जो संयुक्त all-gathers के माध्यम से 1.5x से 3x कर्नल-स्तर की गति प्रदान करते हैं। इस रिलीज़ में DeepSeek V4 के लिए sparse MLA समर्थन जोड़ा गया है, जो सम्पूर्ण डिकोड और स्पेकुलेटिव डिकोडिंग सम्भव कराता है, साथ ही AMD Quark NVFP4 समर्थन। स्पेकुलेटिव डिकोडिंग DFlash2 और confidence-scheduled DSpark सत्यापन के साथ आगे बढ़ रही है। Model Runner V2 की परिपक्वता में E/P/D disaggregation और वज़न offloading शामिल है। नए डिफ़ॉल्ट मान लगातार बैचेड टोकन्स की अधिकतम संख्या को 16384 तक बढ़ाते हैं और Mamba मॉडल के लिए प्रीफ़िक्स कैशिंग सक्षम करते हैं। तोड़ने वाले परिवर्तनों में bitsandbytes के आउट-ऑफ़-ट्री प्लगइन में स्थानांतरण और Transformers के 5.15.0 तक अद्यतन शामिल हैं। रिलीज़ एर्टिफ़ैक्ट्स में CUDA 13.0 और ROCm के लिए Python व्हील और कई प्लेटफ़ॉर्म पर Docker इमेज शामिल हैं। नए मॉडल समर्थन में Muse Glimmer, Ling 3.0 और Qwen3.5 सुधार शामिल हैं। यह अपडेट vLLM की स्थिति को बड़े भाषा मॉडल सेविंग के लिए एक अग्रणी ढांचे के रूप में सुदृढ़ करता है।