HeadlinesBriefing favicon HeadlinesBriefing.com

Desagregação: problema de 1000 GPUs, quando funciona

Towards Data Science •
×

Toda grande estrutura de inferência lançou desagregação prefill-decode este ano. A NVIDIA a integrou no Dynamo. A SGLang a tornou o padrão para implantações em grande escala.

A v LLM adicionou uma API de conector KV para suportá-la nativamente. O consenso está se formando rapidamente: divida seu prefill e decode em pools de GPU separados, e a taxa de transferência melhora. O consenso está errado para a maioria das equipes.

A análise da Doubleword mostra que uma implantação desagregada equilibrada corresponde à taxa de transferência colocalizada, mas com pequenas contagens de GPU as perdas de arredondamento dominam: você não pode alocar GPUs fracionários, então os ganhos de especialização são consumidos pela utilização incompleta dos workers. O benefício prático nessa escala é o ajuste independente de SLO, não a taxa de transferência. Um estudo de junho de 2025 avaliando centenas de milhares de pontos de design descobriu que a desagregação é mais eficaz para padrões de tráfego pesados em prefill e modelos maiores.

Para as cargas de trabalho de tráfego misto que a maioria das equipes realmente executa, o enfileiramento e a transferência de cache KV entre nós dominaram a latência de ponta a ponta. As equipes que desagregaram moveram o gargalo. Elas não o removeram.

Eu me deparei com isso em uma carga de trabalho de inferência servindo um modelo de classificação de médio porte. O TPOT disparou sob tráfego em rajadas, e o primeiro instinto foi separar o prefill do decode. Em vez disso, ativei o prefill em pedaços no mesmo pool de GPUs.

O TPOT se estabilizou. O problema era interferência de agendamento, e o prefill em pedaços lidou com isso sem adicionar um salto de rede. O prefill em pedaços divide requisições longas de prefill em pedaços menores e os intercala com lotes de decode na mesma GPU.

Sem pools de nós separados. Sem transferência de cache KV pela rede. Sem proporção P:D para ajustar.

A TNG Technology Consulting mediu um aumento de 50 por cento na taxa de transferência total de tokens usando v LLM padrão com prefill em pedaços ativado. Os lotes de decode ainda eram executados entre pedaços de prefill no mesmo hardware, mas a interferência de agendamento caiu para um nível que a maioria das cargas de trabalho de produção pode tolerar. Para cargas de trabalho abaixo de aproximadamente 50 requisições por segundo com comprimentos de prompt moderados, esse limite é suficientemente restrito.