HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0: Pembaruan Performa & Platform

Hacker News •
×

Rilis v0.28.0 dari proyek sumber terbuka vLLM memperkenalkan 584 commit dari 270 kontributor, menandai dorongan performa signifikan untuk Kimi-K3. Optimisasi kunci termasuk dukungan Decode Context Parallel (DCP) dan kernel Flash KDA yang digabungkan, memberikan percepatan tingkat kernel sebesar 1.5x hingga 3x melalui all-gathers yang digabungkan. Rilis ini menambahkan dukungan sparse MLA untuk DeepSeek V4, memungkinkan dekode end-to-end dan dekode spekulatif, disertai dukungan AMD Quark NVFP4.

Kemajuan dalam dekode spekulatif dilakukan dengan DFlash2 dan verifikasi DSpark yang dijadwalkan berdasarkan kepercayaan. Kematangan Model Runner V2 mencakup desagregasi E/P/D dan peng offload berat. Pengaturan baru meningkatkan jumlah maksimum token yang diproses secara batch ke 16384 dan mengaktifkan caching prefix untuk model Mamba.

Perubahan yang menyampingkan termasuk migrasi bitsandbytes ke plugin eksternal dan pembaruan Transformers ke 5.15.0. Artefak rilis mencakup roda Python untuk CUDA 13.0 dan ROCm, serta gambar Docker di berbagai platform. Dukungan model baru mencakup peningkatan Muse Glimmer, Ling 3.0, dan Qwen3.5.

Pembaruan ini memperkuat posisi vLLM sebagai kerangka kerja terkemuka untuk layanan model bahasa besar.