HeadlinesBriefing HeadlinesBriefing.com

DFlash 2: تصياغ موازي أسرع لاستنتاج الذكاء الاصطناعي

Hacker News •
×

أصبح الاستنتاج هو الاختناق في عصر الوكلاء، حيث يستهلك الوكلاء الرموز بمعدلات غير مسبوقة. تقوم Inco AI ببناء بنية الاستنتاج للاقتصاد الجديد للرموز. الإصدار الأصلي DFlash، الذي تم إصداره في يناير، يعمل الآن على SGLang، vLLM، TensorRT-LLM، و llama.cpp، ويحقق حتى 15 ضرب الإنتاجية على بطاقات شريحة NVIDIA Blackwell و3 مرات المزيد من الرموز في الثانية على وحدات TPUs.

قام DFlash بمقدمة تصييغ تكهني أحادي المرة، يتنبأ بكتل كاملة من الرموز في الموازاة بدلاً من بشكل أوتوريجرسيف. يعتمد DFlash 2 على هذا الأسلوب باسترجاع أكثر من 20% من الإخراج الإضافي في كل جولة تحقق باستهلاك 1% فقط من الزمن الإضافي. يستخدم هذا الأسلوب منتقي مسار خفيف يقيس أزواج الرموز المجاورة بدلاً من الاعتماد على تصحيحات تسلسلية مكلفة.

Qwen3-8-27B مُصممو DFlash 2 متاحون اليوم، مما يتيح لـ SGLang تقديم الخدمة بسرعة 2.7-3.4 ضعف سرعة فك الترميز الأوتوريجرسيف. يحتفظ المنتقي بأفضل 16 مرشحًا لكل موقع ويتبع مسارات متماسكة من خلالها باستخدام انتباه ثنائي الدرجة المنخفضة، مما يبقيه تمامًا موازيًا بأقل تكلفة ممكنة.

يعمل DFlash 2 بالفعل على محركات استنتاج رئيسية بما في ذلك SGLang، vLLM، llama.cpp، وOllama، مع توفير تعليمات تثبيت لكل منصة.

المصدر: Hacker News · لخّصه HeadlinesBriefing