इन्फ्रेंस एजेंट युग का बंधन बिंदु बन गया है, जहां एजेंट अभूतपूर्व दर से टोकन उपयोग कर रहे हैं। Inco AI इस नए टोकन अर्थव्यवस्था के लिए इन्फ्रेंस स्टैक निर्माण कर रहा है। जनवरी में लॉन्च किए गए मूल DFlash अब SGLang, vLLM, TensorRT-LLM और llama.cpp में चल रहा है, NVIDIA Blackwell GPU पर 15 गुना आउटपुट और TPU पर 3 गुना अधिक टोकन प्राप्त करता है।
DFlash ने एक-पास स्पेकुलेटिव ड्राफ्टिंग पेश की, पूरे टोकन ब्लॉक की भविष्यवाणी करने के बजाय ऑटोरेग्रेसिव रूप से। DFlash 2 इसी पर आधारित है, केवल 1% अतिरिक्त विलंब के साथ प्रत्येक सत्यापन पास में 20% अधिक आउटपुट हासिल करता है। यह दृष्टिकोण एक हल्का पथ चयनकर्ता का उपयोग करता है जो महंगे अनुक्रमिक सुधारों पर निर्भर नहीं करता, बल्कि आसपास के टोकन जोड़ों का स्कोरिंग करता है।
Qwen3-8-27B DFlash 2 ड्राफ्टर आज उपलब्ध हैं, जिससे SGLang ऑटोरेग्रेसिव डिकोडिंग की तुलना में 2.7-3.4 गुना आउटपुट प्रदान कर सकता है। चयनकर्ता प्रत्येक स्थिति पर 16 शीर्ष उम्मीदवारों को रखता है और कम रैंक बाइलीनियर ध्यान का उपयोग करके उनके माध्यम से स्पष्ट पथों का पीछा करता है, जो पूरी तरह से समानांतर रहता है और न्यूनतम ओवरहेड के साथ।
DFlash 2 पहले से ही मुख्य इन्फ्रेंस इंजन में चल रहा है, जिसमें SGLang, vLLM, llama.cpp और Ollama शामिल हैं, और प्रत्येक प्लेटफॉर्म के लिए स्थापना निर्देश प्रदान किए गए हैं।
स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित