HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0: Actualizaciones de rendimiento y plataforma

Hacker News •
×

El lanzamiento v0.28.0 del proyecto de código abierto vLLM introduce 584 commits de 270 contribuyentes, marcando un importante impulso de rendimiento para Kimi-K3. Las optimizaciones clave incluyen el soporte de Decode Context Parallel (DCP) y kernels Flash KDA fusionados, proporcionando una aceleración a nivel de kernel de 1.5x a 3x mediante all-gathers combinados. El lanzamiento añade soporte de MLA dispersa para DeepSeek V4, permitiendo decodificación de extremo a extremo y decodificación especulativa, junto con el soporte de AMD Quark NVFP4.

El avance en decodificación especulativa incluye verificación de DFlash2 y DSpark basada en confianza. La maduración de Model Runner V2 incluye desagregación E/P/D y descarga de pesos. Los nuevos valores predeterminados aumentan los tokens por lote máximos a 16384 y habilitan el almacenamiento en caché de prefijos para modelos Mamba.

Los cambios disruptivos incluyen la migración de bitsandbytes a un complemento externo y una actualización de Transformers a 5.15.0. Los artefactos de lanzamiento incluyen ruedas de Python para CUDA 13.0 y ROCm, además de imágenes Docker en múltiples plataformas. El soporte de nuevos modelos incluye mejoras de Muse Glimmer, Ling 3.0 y Qwen3.5.

La actualización consolida la posición de vLLM como un marco líder para el servicio de modelos de lenguaje grande.