HeadlinesBriefing HeadlinesBriefing.com

DFlash 2: AI推論の高速並列ドラフティング

Hacker News •
×

推論はエージェント時代のボトルネックになりました。エージェントは前例のない速度でトークンを消費しています。Inco AIはこの新しいトークン経済のために推論スタックを構築しています。1月にリリースされた元のDFlashは、SGLang、vLLM、TensorRT-LLM、llama.cppで実行されており、NVIDIA Blackwell GPUで最大15倍のスループットとTPUで3倍のトークン/秒を実現しています。

DFlashは、自律回帰的ではなく、並列で完全なトークンブロックを予測する単一パスの推測ドラフティングを導入しました。DFlash 2は、わずか1%の遅延で、各検証パスで20%以上の追加出力を回復します。このアプローチは、隣接するトークンペアにスコアを付ける軽量パスセレクターを使用し、高価な順次修正に依存しません。

Qwen3-8-27B DFlash 2ドラフターは今日から利用可能で、SGLangが自律回帰デコーディングの2.7〜3.4倍のスループットでサービスを提供できます。セレクターは各位置に16個の上位候補を保持し、低ランク双線形注意を使用してそれらを通じて一貫したパスを追跡し、最小限のオーバーヘッドで完全に並列に保ちます。

DFlash 2は、SGLang、vLLM、llama.cpp、Ollamaを含む主要な推論エンジンで既に実行されており、各プラットフォーム向けのインストール手順が提供されています。

出典: Hacker News · 要約:HeadlinesBriefing