HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0: Atualizações de desempenho e plataforma

Hacker News •
×

O lançamento v0.28.0 do projeto de código aberto vLLM introduz 584 commits de 270 contribuidores, marcando um avanço significativo no desempenho para Kimi-K3. As otimizações principais incluem suporte a Decode Context Parallel (DCP) e kernels Flash KDA fusionados, proporcionando uma aceleração no nível do kernel de 1,5x a 3x por meio de all-gathers combinados. O lançamento adiciona suporte a MLA esparsa para DeepSeek V4, permitindo decodificação de ponta a ponta e decodificação especulativa, juntamente com suporte a AMD Quark NVFP4.

O avanço na decodificação especulativa inclui DFlash2 e verificação DSpark programada por confiança. A maturação do Model Runner V2 apresenta desagregação E/P/D e descarregamento de pesos. As novas configurações padrão aumentam o número máximo de tokens por lote para 16384 e habilitam cache de prefixo para modelos Mamba.

As alterações interruptivas incluem a migração de bitsandbytes para um plugin externo à árvore e uma atualização do Transformers para 5.15.0. Os artefatos de lançamento incluem rodas Python para CUDA 13.0 e ROCm, além de imagens Docker em várias plataformas. O suporte a novos modelos inclui melhorias de Muse Glimmer, Ling 3.0 e Qwen3.5.

A atualização solidifica a posição do vLLM como um framework líder para o serviço de modelos de linguagem de grande porte.