推理已成为智能体时代的瓶颈,智能体以前所未有的速度消费token。Inco AI正在为这一新的token经济体构建推理栈。最初发布于1月份的DFlash现已在SGLang、vLLM、TensorRT-LLM和llama.cpp中运行,在NVIDIA Blackwell GPU上实现高达15倍吞吐量,在TPU上实现3倍更多每秒token。
DFlash引入了一次性推测性草拟技术,预测整个token块而非自回归方式。DFlash 2在此基础上,通过仅增加1%延迟,恢复超过20%更多的输出。该方法使用轻量级路径选择器,对相邻token对进行评分,而非依赖昂贵的顺序修正。
Qwen3-8-27B DFlash 2草拟器已正式发布,使SGLang的服务吞吐量达到自回归解码的2.7-3.4倍。该选择器在每个位置保留16个顶级候选,并使用低秩双线性注意力追踪它们之间的连贯路径,保持完全并行且开销最小。
DFlash 2已在主流推理引擎中运行,包括SGLang、vLLM、llama.cpp和Ollama,并为每个平台提供安装说明。
来源: Hacker News · 由HeadlinesBriefing整理摘要