HeadlinesBriefing HeadlinesBriefing.com

DFlash 2 : Rédaction Parallèle Plus Rapide pour l'IA

Hacker News •
×

L'inférence est devenue le goulot d'étranglement de l'ère des agents, les agents consommant des jetons à des taux sans précédent. Inco AI construit la pile d'inférence pour cette nouvelle économie de jetons. Le DFlash original, publié en janvier, fonctionne désormais sur SGLang, vLLM, TensorRT-LLM et llama.cpp, atteignant jusqu'à 15 fois le débit sur les GPU NVIDIA Blackwell et 3 fois plus de jetons par seconde sur les TPU.

DFlash a introduit la rédaction spéculative à un seul passage, prédit des blocs entiers de jetons en parallèle plutôt qu'à faible progression. DFlash 2 s'appuie sur cela en récupérant plus de 20% de sortie supplémentaire par passage de vérification avec seulement 1% de latence supplémentaire. L'approche utilise un sélecteur de chemin léger qui évalue les paires de jetons adjacents au lieu de s'appuyer sur des corrections séquentielles coûteuses.

Les rédacteurs Qwen3-8-27B DFlash 2 sont disponibles aujourd'hui, permettant à SGLang de servir à 2.7-3.4 fois le débit de la décryption autorégressive. Le sélecteur conserve les 16 meilleurs candidats par position et trace des chemins cohérents à travers eux en utilisant une attention bilinéaire à faible rang, restant entièrement parallèle avec un overhead minimal.

DFlash 2 fonctionne déjà dans les moteurs d'inférence principaux y compris SGLang, vLLM, llama.cpp et Ollama, avec des instructions d'installation fournies pour chaque plateforme.

Source: Hacker News · Résumé par HeadlinesBriefing