HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0 : Mises à jour de performance et de plateforme

Hacker News •
×

La version v0.28.0 du projet open source vLLM introduit 584 commits de 270 contributeurs, marquant une avancée significative en termes de performance pour Kimi-K3. Les optimisations clés comprennent la prise en charge de Decode Context Parallel (DCP) et les noyaux Flash KDA fusionnés, offrant une accélération au niveau du noyau de 1,5x à 3x via des all-gathers combinés. La version ajoute le support de MLA creuse pour DeepSeek V4, permettant le décodage de bout en bout et le décodage spéculatif, ainsi que le support d’AMD Quark NVFP4.

Le décodage spéculatif progresse avec DFlash2 et la vérification DSpark planifiée selon la confiance. La maturation de Model Runner V2 comprend la désagrégation E/P/D et le déchargement de poids. Les nouveaux paramètres par défaut augmentent le nombre maximal de jetons par lot à 16384 et activent la mise en cache des préfixes pour les modèles Mamba.

Les changements cassants incluent la migration de bitsandbytes vers un plugin externe à l’arbre et une mise à jour de Transformers à 5.15.0. Les artefacts de publication comprennent des roues Python pour CUDA 13.0 et ROCm, ainsi que des images Docker sur plusieurs plateformes. Le support des nouveaux modèles inclut les améliorations de Muse Glimmer, Ling 3.0 et Qwen3.5.

La mise à jour consolide la position de vLLM en tant que cadre leader pour le déploiement de grands modèles linguistiques.