HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0: Leistungs- und Plattformaktualisierungen

Hacker News •
×

Die v0.28.0-Version des Open-Source-Projekts vLLM enthält 584 Commits von 270 Beitragenden und markiert einen bedeutenden Leistungsschub für Kimi-K3. Zu den wichtigsten Optimierungen gehören die Unterstützung für Decode Context Parallel (DCP) und fusionierte Flash KDA-Kerne, die eine kernbasierte Beschleunigung von 1,5x bis 3x durch kombinierte All-Gathers ermöglichen. Die Version fügt Unterstützung für sparse MLA für DeepSeek V4 hinzu, was End-to-End-Decodierung und spekulative Decodierung ermöglicht, sowie Unterstützung für AMD Quark NVFP4.

Der Fortschritt bei spekulativer Decodierung erfolgt mit DFlash2 und vertrauensbasierten DSpark-Überprüfungen. Die Reiferung von Model Runner V2 umfasst E/P/D-Desaggregation und Gewichtsentlastung. Neue Standardwerte erhöhen die maximale Anzahl von Batch-Tokens auf 16384 und aktivieren Präfix-Caching für Mamba-Modelle.

Breaking Changes umfassen die Migration von bitsandbytes zu einem Out-of-Tree-Plugin und ein Transformers-Update auf 5.15.0. Veröffentlichungs-Artefakte enthalten Python-Räder für CUDA 13.0 und ROCm sowie Docker-Images für mehrere Plattformen. Die Unterstützung neuer Modelle umfasst Muse Glimmer, Ling 3.0 und Qwen3.5-Erweiterungen.

Das Update stärkt die Position von vLLM als führender Rahmen für die Bereitstellung großer Sprachmodelle.