HeadlinesBriefing favicon HeadlinesBriefing.com

Désagrégation: problème de 1000 GPU, quand ça marche

Towards Data Science •
×

Chaque framework d'inférence majeur a livré la désagrégation prefill-decode cette année. NVIDIA l'a intégré dans Dynamo. SGLang l'a rendu par défaut pour les déploiements à grande échelle. v LLM a ajouté une API de connecteur KV pour le prendre en charge nativement.

Le consensus se forme rapidement : séparez votre prefill et votre decode sur des pools de GPU distincts, et le débit s'améliore. Le consensus est faux pour la plupart des équipes. L'analyse de Doubleword montre qu'un déploiement désagrégé équilibré correspond au débit colocalisé, mais avec de petits nombres de GPU, les pertes d'arrondi dominent : vous ne pouvez pas allouer des GPU fractionnels, donc les gains de spécialisation sont consommés par une utilisation incomplète des workers.

L'avantage pratique à cette échelle est le réglage indépendant des SLO, pas le débit. Une étude de juin 2025 évaluant des centaines de milliers de points de conception a révélé que la désagrégation est plus efficace pour les modèles de trafic lourds en prefill et les modèles plus grands. Pour les charges de travail à trafic mixte que la plupart des équipes exécutent réellement, la file d'attente et le transfert de cache KV entre nœuds ont dominé la latence de bout en bout.

Les équipes qui ont désagrégé ont déplacé le goulot d'étranglement. Ils ne l'ont pas éliminé. J'ai rencontré cela sur une charge de travail d'inférence servant un modèle de classification de taille moyenne.

Le TPOT a augmenté sous un trafic en rafale, et le premier instinct a été de séparer le prefill du decode. Au lieu de cela, j'ai activé le prefill fragmenté sur le même pool de GPU. Le TPOT s'est stabilisé.

Le problème était l'interférence de planification, et le prefill fragmenté l'a géré sans ajouter de saut réseau. Le prefill fragmenté divise les longues requêtes de prefill en morceaux plus petits et les entrelace avec les lots de decode sur le même GPU. Pas de pools de nœuds séparés.

Pas de transfert de cache KV sur le réseau. Pas de ratio P:D à régler. TNG Technology Consulting a mesuré une augmentation de 50 pour cent du débit total de tokens en utilisant v LLM standard avec prefill fragmenté activé.

Les lots de decode continuaient de s'exécuter entre les morceaux de prefill sur le même matériel, mais l'interférence de planification est tombée à un niveau que la plupart des charges de travail de production peuvent tolérer. Pour les charges de travail inférieures à environ 50 requêtes par seconde avec des longueurs de prompt modérées, cette borne est suffisamment stricte.