HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0:主要なパフォーマンスとプラットフォームの更新

Hacker News •
×

オープンソースプロジェクトvLLMのv0.28.0リリースには、270人のコントリビューターによる584件のコミットが含まれており、Kimi-K3に対する重要なパフォーマンス向上を示しています。主な最適化には、Decode Context Parallel (DCP)のサポートと融合Flash KDAカーネルが含まれ、結合されたall-gatherによって1.5倍から3倍のカーネルレベルの高速化を実現しています。このリリースでは、DeepSeek V4向けのスパースMLAサポートを追加し、エンドツーエンドのデコードと推測デコードを可能にするとともに、AMD Quark NVFP4のサポートも追加しています。推測デコードはDFlash2と信頼度スケジュールされたDSpark検証の進展により進んでいます。Model Runner V2の成熟度では、E/P/D分離と重みオフロードが特徴です。新しいデフォルトでは、最大バッチトークン数を16384に引き上げ、Mambaモデル向けのプレフィックスキャッシングを有効にしています。破壊的変更には、bitsandbytesのツリー外プラグインへの移行とTransformersの5.15.0へのアップグレードが含まれます。リリースアーティファクトには、CUDA 13.0とROCm向けのPythonホイールや、複数のプラットフォーム向けのDockerイメージが含まれます。新しいモデルサポートには、Muse Glimmer、Ling 3.0、Qwen3.5の強化が含まれます。このアップデートにより、vLLMは大規模言語モデルのサービングにおける主要なフレームワークとしての地位を確固たるものにしています。