HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0发布:重大性能与平台更新

Hacker News •
×

vLLM开源项目的v0.28.0版本引入了来自270位贡献者的584次提交,标志着Kimi-K3迎来一次重大的性能推进。关键优化包括Decode Context Parallel (DCP)支持和融合Flash KDA内核,通过组合all-gather操作实现1.5倍到3倍的内核级加速。该版本新增了对DeepSeek V4的稀疏MLA支持,实现端到端解码和推测性解码,以及AMD Quark NVFP4支持。推测性解码在DFlash2和基于置信度的DSpark验证方面取得进展。Model Runner V2的成熟特征包括E/P/D解聚和权重卸载。新的默认设置将最大批处理标记数提升至16384,并为Mamba模型启用前缀缓存。重大变更包括将bitsandbytes迁移到树外插件以及Transformers升级至5.15.0。发布工件包括适用于CUDA 13.0和ROCm的Python轮子,以及跨多个平台的Docker镜像。新增模型支持包括Muse Glimmer、Ling 3.0和Qwen3.5增强功能。该更新巩固了vLLM作为大语言模型服务领域领先框架的地位。