HeadlinesBriefing HeadlinesBriefing.com

DFlash 2: Borrador Paralelo Más Rápido para IA

Hacker News •
×

La inferencia se ha convertido en el cuello de botella de la era de los agentes, con agentes consumiendo tokens a velocidades sin precedentes. Inco AI está construyendo la pila de inferencia para esta nueva economía de tokens. El original DFlash, lanzado en enero, ahora se ejecuta en SGLang, vLLM, TensorRT-LLM y llama.cpp, alcanzando hasta 15 veces el rendimiento en GPUs NVIDIA Blackwell y 3 veces más tokens por segundo en TPUs.

DFlash introdujo el borrador especulativo de un solo pase, prediciendo bloques completos de tokens en paralelo en lugar de de forma autorregresiva. DFlash 2 se basa en esto recuperando más del 20% de salida adicional por pasada de verificación con solo 1% de latencia adicional. El enfoque utiliza un selector de ruta ligero que puntúa pares de tokens adyacentes en lugar de depender de correcciones secuenciales costosas.

Los redactores Qwen3-8-27B DFlash 2 están disponibles hoy, permitiendo a SGLang servir a 2.7-3.4 veces el rendimiento del descodificación autorregresiva. El selector mantiene las 16 mejores candidatas por posición y traza caminos coherentes a través de ellas usando atención bilineal de rango bajo, manteniéndose completamente paralelo con mínima sobrecarga.

DFlash 2 ya se ejecuta en motores de inferencia principales incluyendo SGLang, vLLM, llama.cpp y Ollama, con instrucciones de instalación proporcionadas para cada plataforma.

Fuente: Hacker News · Resumido por HeadlinesBriefing