HeadlinesBriefing favicon HeadlinesBriefing.com

VLLM v0.28.0: প্রধান্য পারফর্ম্যান্স ও প্ল্যাটফর্ম আপডেট

Hacker News •
×

vLLM ওপেন-সোর্স প্রকল্পের v0.28.0 রিলিজে 270 অবদানকারীর 584টি কমিট রয়েছে, যা Kimi-K3-এর জন্য একটি উল্লেখযোগ্য পারফর্ম্যান্স বৃদ্ধির সংকেত দেয়। মূল অপ্টিমাইজেশনর্সের মধ্যে Decode Context Parallel (DCP) সমর্থন এবং fused Flash KDA কার্নেল অন্তর্ভুক্ত রয়েছে, যা সংযুক্ত all-gathers-এর মাধ্যমে 1.5x থেকে 3x কার্নেল-স্তরের গতি প্রদান করে। রিলিজে DeepSeek V4-এর জন্য sparse MLA সমর্থন যোগ করা হয়েছে, যা end-to-end ডিকোড এবং স্পেকুলেটিভ ডিকোডিং সম্ভব করে তোলে, এবং AMD Quark NVFP4 সমর্থন। স্পেকুলেটিভ ডিকোডিং DFlash2 এবং confidence-scheduled DSpark যাচাইকরণ নিয়ে অগ্রাধিকার পায়। Model Runner V2-এর পরিপূর্ণতা বৈশিষ্ট্যগুলির মধ্যে E/P/D disaggregation এবং ওজন offloading অন্তর্ভুক্ত রয়েছে। নতুন ডিফল্ট মান গর্ভ ব্যাচে টোকেন সর্বোচ্চ সীমাকে 16384 পর্যন্ত বাড়ায় এবং Mamba মডেলের জন্য প্রিফিক্স ক্যাশিং সক্ষম করে। ভেঙ্গে যাওয়া পরিবর্তনগুলিতে bitsandbytes-এর আউট-অফ-ট্রি প্লাগইনে স্থানান্তর এবং Transformers-এর 5.15.0 পর্যন্ত আপগ্রেড অন্তর্ভুক্ত রয়েছে। রিলিজ আর্টিফ্যাক্টগুলিতে CUDA 13.0 এবং ROCm-এর জন্য Python হাব এবং একাধিক প্ল্যাটফর্মে ডকার ইমেজ অন্তর্ভুক্ত রয়েছে। নতুন মডেল সমর্থনের মধ্যে Muse Glimmer, Ling 3.0 এবং Qwen3.5 উন্নয়ন অন্তর্ভুক্ত রয়েছে। এই আপডেটটি vLLM-এর বড় ভাষা মডেল সেবা জন্য একটি অগ্রণী ফ্রেমওয়ার্ক হিসাবে অবস্থানকে শক্তিশালী করে তোলে।