HeadlinesBriefing HeadlinesBriefing.com

DFlash 2: Быстрое параллельное черновое написание для ИИ

Hacker News •
×

Инференс стал узким местом эпохи агентов, при этом агенты расходуют токены с непревзойденной скоростью. Inco AI строит стек инференса для этой новой экономики токенов. Первоначальный DFlash, выпущенный в январе, теперь работает на SGLang, vLLM, TensorRT-LLM и llama.cpp, достигая до 15-кратного пропускной способности на GPU NVIDIA Blackwell и 3-кратного количества токенов в секунду на TPU.

DFlash представил однопроходное спекулятивное черновое написание, предсказывая целые блоки токенов параллельно, а не авторегрессивно. DFlash 2 строится на этом, восстанавливая более 20% дополнительного выхода на каждом проходе проверки с всего 1% дополнительной задержки. Подход использует легкий селектор пути, который оценивает соседние пары токенов, вместо того чтобы полагаться на дорогостоящие последовательные исправления.

Qwen3-8-27B черновики DFlash 2 доступны сегодня, позволяя SGLang обслуживать в 2.7-3.4 раза больше пропускной способности по сравнению с авторегрессивным декодированием. Селектор сохраняет 16 лучших кандидатов на каждую позицию и прослеживает связные пути через них с использованием низкорангового билинейного внимания, оставаясь полностью параллельным с минимальными накладными расходами.

DFlash 2 уже работает в основных движках инференса, включая SGLang, vLLM, llama.cpp и Ollama, с инструкциями по установке для каждой платформы.

Источник: Hacker News · Сводку подготовил HeadlinesBriefing