HeadlinesBriefing favicon HeadlinesBriefing.com

ディスアグリゲーション:1000 GPU問題、いつ機能する

Towards Data Science •
×

主要な推論フレームワークはすべて今年プレフィル・デコードディスアグリゲーションを出荷した。NVIDIAはそれをDynamoに組み込んだ。SGLangは大規模デプロイメントのデフォルトにした。v LLMはネイティブにサポートするためのKVコネクタAPIを追加した。コンセンサスは急速に形成されている:プレフィルとデコードを別々のGPUプールに分割すれば、スループットが向上する。このコンセンサスはほとんどのチームにとって間違っている。Doublewordの分析は、バランスの取れたディスアグリゲートされたデプロイメントがコロケーションのスループットに匹敵することを示しているが、GPU数が少ない場合、丸め損失が支配的になる:分数のGPUを割り当てることはできないため、特殊化の利益は不完全なワーカー利用率に食い潰される。そのスケールでの実用的な利益はスループットではなく、独立したSLOチューニングである。数十万の設計ポイントを評価した2025年6月の研究で、ディスアグリゲーションはプレフィル中心のトラフィックパターンとより大きなモデルに最も効果的であることが分かった。ほとんどのチームが実際に実行する混合トラフィックのワークロードでは、キューイングとノード間KVキャッシュ転送がエンドツーエンドのレイテンシを支配していた。ディスアグリゲーションを採用したチームはボトルネックを移動させた。それを取り除いたのではない。私は中規模の分類モデルを提供する推論ワークロードでこれに遭遇した。バーストトラフィック下でTPOTが急増し、最初の直感はプレフィルをデコードから分離することだった。代わりに、同じGPUプールでチャンク化プレフィルを有効にした。TPOTは安定した。問題はスケジューリング干渉であり、チャンク化プレフィルはネットワークホップを追加せずにそれを処理した。チャンク化プレフィルは長いプレフィルリクエストをより小さなチャンクに分割し、同じGPU上のデコードバッチとインターリーブする。別のノードプールはない。ネットワーク経由のKVキャッシュ転送はない。チューニングするP:D比率はない。TNG Technology Consultingは、チャンク化プレフィルを有効にした標準のv LLMを使用して、総トークンスループットの50%増加を測定した。デコードバッチは同じハードウェア上のプレフィルチャンク間でまだ実行されていたが、スケジューリング干渉はほとんどの本番ワークロードが許容できるレベルに低下した。プロンプト長が中程度で1秒あたり約50リクエスト以下のワークロードでは、その境界は十分にタイトである。