অনুমান এখন এজেন্ট যুগের গ্লোটল্যাক পয়েন্ট হয়ে উঠেছে, যেখানে এজেন্টরা অভূতপূর্ব হারে টোকেন ব্যবহার করছে। Inco AI এই নতুন টোকেন অর্থনীতির জন্য অনুমান স্ট্যাক নির্মাণ করছে। জানুয়ারি মাসে প্রকাশিত মূল DFlash এখন SGLang, vLLM, TensorRT-LLM এবং llama.cpp-এ চালু হয়েছে, NVIDIA Blackwell GPU-এ 15 গুণ পর্যন্ত থ্রুপুট এবং TPU-তে সেকেন্ডে 3 গুণ বেশি টোকেন অর্জন করে।
DFlash একবারের বিশ্বাসযোগ্য রেখাংকন চালু করেছিল, সম্পূর্ণ টোকেন ব্লক ভবিষ্যদ্বাণী করে স্বয়ংক্রিয়ভাবে নয়। DFlash 2 এটিতে ভিত্তি রেখে শুধুমাত্র 1% অতিরিক্ত লেটেন্সি নিয়ে প্রতিটি যাচাইকরণ পাসে 20% বেশি আউটপুট পুনরুদ্ধৃত করে। এই পদ্ধতিটি একটি হাল্কা পাথ সিলেক্টর ব্যবহার করে যা মহংগা ক্রমাগত ভুল প্রশিক্ষণের উপর নির্ভর করে না, বরং সন্নিহিত টোকেন জোড়ের মূল্যায়ন করে।
Qwen3-8-27B DFlash 2 রেখাংকনকারী আজই উপলধি আছে, যা SGLang-এর স্বয়ংক্রিয় রিকডিং-এর চেয়ে 2.7-3.4 গুণ থ্রুপুট প্রদান করতে দেয়। সিলেক্টর প্রতিটি অবস্থানে 16টি শীর্ষ প্রারথমিককে ধরে রাখে এবং কম র্যাঙ্ক বাইলিনিয়ার অ্যাটেনশন ব্যবহার করে তাদের মধ্য দিয়ে স্পষ্ট পথ অনুসরণ করে, যা পূর্ণতর সমান্য এবং অপরিষ্কার ওভারহেড সহ।
DFlash 2 ইতিমধ্যে মুখ্য অনুমান ইঞ্জিনে চালু হয়েছে যার মধ্যে SGLang, vLLM, llama.cpp এবং Ollama অন্তর্ভুক্ত রয়েছে, এবং প্রতিটি প্ল্যাটফর্মের জন্য ইনস্টলেশন নির্দেশাবলী প্রদান করা হয়েছে।
উৎস: Hacker News · সারাংশ: HeadlinesBriefing