HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0: Обновления производительности и платформы

Hacker News •
×

Релиз v0.28.0 проекта vLLM с открытым исходным кодом включает 584 коммитов от 270 участников, что ознаменует значительный прогресс в производительности для Kimi-K3. Ключевые оптимизации включают поддержку Decode Context Parallel (DCP) и свернутые Flash KDA ядра, обеспечивая ускорение на уровне ядра от 1.5x до 3x с помощью объединенных all-gather операций. Релиз добавляет поддержку разреженого MLA для DeepSeek V4, что позволяет выполнять декодирование от начала до конца и спекулятивное декодирование, а также поддержку AMD Quark NVFP4. Спекулятивное декодирование продвигается с DFlash2 и проверкой DSpark, запланированной по уровню доверия. Зрелость Model Runner V2 включает десагрегацию E/P/D и выгрузку весов. Новые значения по умолчанию увеличивают максимальное количество токенов в пакете до 16384 и включают кэширование префиксов для моделей Mamba. Нарушающие изменения включают миграцию bitsandbytes в плагин вне дерева и обновление Transformers до 5.15.0. Артефакты релиза включают Python-колеса для CUDA 13.0 и ROCm, а также образы Docker для нескольких платформ. Поддержка новых моделей включает улучшения Muse Glimmer, Ling 3.0 и Qwen3.5. Обновление закрепляет позицию vLLM как ведущего фреймворка для обслуживания больших языковых моделей.