HeadlinesBriefing HeadlinesBriefing.com

DFlash 2: Redação Paralela Mais Rápida para Inferência de IA

Hacker News •
×

A inferência se tornou o gargalo da era dos agentes, com agentes consumindo tokens a taxas sem precedentes. Inco AI está construindo a pilha de inferência para esta nova economia de tokens. O original DFlash, lançado em janeiro, agora é executado no SGLang, vLLM, TensorRT-LLM e llama.cpp, atingindo até 15x a taxa de transferência em GPUs NVIDIA Blackwell e 3x mais tokens por segundo em TPUs.

DFlash introduziu a redação especulativa em uma única passagem, prevendo blocos inteiros de tokens em paralelo em vez de de forma autorregressiva. DFlash 2 baseia-se nisto recuperando mais de 20% de saída adicional por passagem de verificação com apenas 1% de latência adicional. A abordagem utiliza um seletor de caminho leve que pontua pares de tokens adjacentes em vez de depender de correções sequenciais caras.

Qwen3-8-27B redatores DFlash 2 estão disponíveis hoje, permitindo que o SGLang sirva a 2.7-3.4x a taxa de transferência da decodificação autorregressiva. O seletor mantém os 16 melhores candidatos por posição e segue caminhos coerentes através deles usando atenção bilinear de baixa classificação, mantendo-se totalmente paralelo com overhead mínimo.

DFlash 2 já está em execução em motores de inferência principais incluindo SGLang, vLLM, llama.cpp e Ollama, com instruções de instalação fornecidas para cada plataforma.

Fonte: Hacker News · Resumido por HeadlinesBriefing