HeadlinesBriefing favicon HeadlinesBriefing.com

Desagregación: problema de 1000 GPUs, cuándo funciona

Towards Data Science •
×

Cada framework de inferencia importante envió desagregación prefill-decode este año. NVIDIA la integró en Dynamo. SGLang la hizo predeterminada para despliegues a gran escala. v LLM añadió una API de conector KV para soportarla nativamente.

El consenso se está formando rápidamente: divide tu prefill y decode en pools de GPU separados, y el throughput mejora. El consenso es incorrecto para la mayoría de los equipos. El análisis de Doubleword muestra que un despliegue desagregado equilibrado iguala el throughput colocalizado, pero con recuentos pequeños de GPU las pérdidas por redondeo dominan: no puedes asignar GPUs fraccionarias, por lo que las ganancias de especialización son consumidas por la utilización incompleta de los workers.

El beneficio práctico a esa escala es el ajuste independiente de SLO, no el throughput. Un estudio de junio de 2025 que evaluó cientos de miles de puntos de diseño encontró que la desagregación es más efectiva para patrones de tráfico intensivos en prefill y modelos más grandes. Para las cargas de tráfico mixto que la mayoría de los equipos ejecutan realmente, la cola y la transferencia de caché KV entre nodos dominaron la latencia de extremo a extremo.

Los equipos que desagregaron movieron el cuello de botella. No lo eliminaron. Me encontré con esto en una carga de trabajo de inferencia que servía un modelo de clasificación de tamaño mediano.

El TPOT se disparó bajo tráfico en ráfagas, y el primer instinto fue separar el prefill del decode. En su lugar, habilité el prefill fragmentado en el mismo pool de GPU. El TPOT se estabilizó.

El problema era la interferencia de programación, y el prefill fragmentado lo manejó sin añadir un salto de red. El prefill fragmentado divide las solicitudes de prefill largas en fragmentos más pequeños y los intercala con lotes de decode en la misma GPU. Sin pools de nodos separados.

Sin transferencia de caché KV por la red. Sin proporción P:D que ajustar. TNG Technology Consulting midió un aumento del 50 por ciento en el throughput total de tokens usando v LLM estándar con prefill fragmentado habilitado.

Los lotes de decode todavía se ejecutaron entre fragmentos de prefill en el mismo hardware, pero la interferencia de programación cayó a un nivel que la mayoría de las cargas de trabajo de producción pueden tolerar. Para cargas de trabajo por debajo de aproximadamente 50 solicitudes por segundo con longitudes de prompt moderadas, ese límite es lo suficientemente ajustado.