HeadlinesBriefing HeadlinesBriefing.com

DFlash 2: Schnelleres paralleles Draften für KI-Inferenz

Hacker News •
×

Inferenz ist zum Engpass der Agentenära geworden, wobei Agenten Tokens in beispiellosen Geschwindigkeiten verbrauchen. Inco AI baut den Inferenz-Stack für diese neue Token-Ökonomie auf. Der ursprüngliche DFlash, der im Januar veröffentlicht wurde, läuft nun auf SGLang, vLLM, TensorRT-LLM und llama.cpp und erreicht bis zu 15-fache Durchsatz auf NVIDIA Blackwell GPUs und 3-mal mehr Tokens pro Sekunde auf TPUs.

DFlash führte einfache spekulative Drafts ein, die ganze Token-Blöcke parallel vorhersagen, anstelle autoregressiv vorzugehen. DFlash 2 baut darauf auf, indem es mehr als 20% mehr Ausgabe pro Verifikationslauf mit nur 1% zusätzlicher Latenz wiederherstellt. Der Ansatz verwendet einen leichten Pfad-Selektor, der benachbarte Token-Paare bewertet, anstelle teurer sequenzieller Korrekturen.

Qwen3-8-27B DFlash 2-Entwürfe sind ab sofort verfügbar und ermöglichen es SGLang, mit 2.7-3.4-fachem Durchsatz wie autoprogressive Decodierung zu dienen. Der Selektor behält die besten 16 Kandidaten pro Position bei und verfolgt kohärente Pfade durch sie mit niedrig ranken bilinearen Aufmerksamkeit, bleibt vollständig parallel mit minimalem Overhead.

DFlash 2 läuft bereits in Haupt-Inferenz-Engines wie SGLang, vLLM, llama.cpp und Ollama, mit Installationsanweisungen für jede Plattform bereitgestellt.

Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing