HeadlinesBriefing HeadlinesBriefing.com

DFlash 2: Penggandaan Draf Lebih Cepat untuk Inferensi AI

Hacker News •
×

Inferensi telah menjadi titik tersumbatan era agen, dengan agen mengonsumsi token dengan laju yang belum pernah ada sebelumnya. Inco AI sedang membangun stak inferensi untuk ekonomi token baru ini. DFlash asli, yang dirilis pada Januari, kini berjalan di SGLang, vLLM, TensorRT-LLM, dan llama.cpp, mencapai hingga 15x throughput pada GPU NVIDIA Blackwell dan 3x lebih banyak token per detik pada TPU.

DFlash memperkenalkan drafting spekulatif satu kali lalu, memprediksi seluruh blok token secara paralel daripada secara autoregresif. DFlash 2 membangun di atas ini dengan memulihkan lebih dari 20% output tambahan per lalu lintas verifikasi dengan hanya 1% latensi tambahan. Pendekatannya menggunakan pemilih jalur ringan yang menilai pasangan token yang berdekatan, bukan bergantung pada koreksi berurutan yang mahal.

Qwen3-8-27B drafters DFlash 2 tersedia hari ini, memungkinkan SGLang untuk melayani dengan 2.7-3.4x throughput dari dekode autoregresif. Pemilih ini menyimpan 16 kandidat teratas per posisi dan melacak jalur yang koheren melaluinya menggunakan perhatian bilinear rendah peringkat, tetap sepenuhnya paralel dengan overhead minimal.

DFlash 2 sudah berjalan di mesin inferensi utama termasuk SGLang, vLLM, llama.cpp, dan Ollama, dengan instruksi instalasi yang disediakan untuk setiap platform.

Sumber: Hacker News · Diringkas oleh HeadlinesBriefing