HeadlinesBriefing favicon HeadlinesBriefing.com

解耦是千GPU问题:何时有效

Towards Data Science •
×

今年,每个主要推理框架都推出了预填充-解码解耦。NVIDIA将其内置于Dynamo中。SGLang将其作为大规模部署的默认选项。v LLM添加了KV连接器API以原生支持它。共识正在快速形成:将预填充和解码拆分到不同的GPU池上,吞吐量就会提升。这个共识对大多数团队来说是错误的。Doubleword的分析表明,平衡的解耦部署可以匹配同置部署的吞吐量,但在GPU数量较少时,舍入损失占主导地位:你无法分配分数个GPU,因此专业化增益被不完整的工作器利用率所吞噬。在这种规模下的实际好处是独立的SLO调优,而不是吞吐量。2025年6月一项评估了数十万个设计点的研究发现,解耦对于预填充密集型流量模式和较大模型最为有效。对于大多数团队实际运行的混合流量工作负载,排队和节点间KV缓存传输主导了端到端延迟。那些采用解耦的团队只是转移了瓶颈。他们并没有消除它。我在一个服务于中型分类模型的推理工作负载上遇到了这个问题。在突发流量下TPOT飙升,第一反应是将预填充与解码分离。相反,我在同一个GPU池上启用了分块预填充。TPOT稳定了。问题在于调度干扰,而分块预填充在不增加网络跳数的情况下解决了它。分块预填充将长预填充请求分解为更小的块,并将它们与同一GPU上的解码批次交错执行。没有单独的节点池。没有通过网络进行KV缓存传输。没有需要调优的P:D比例。TNG Technology Consulting测量到,在标准v LLM上启用分块预填充后,总令牌吞吐量增加了50%。解码批次仍然在同一硬件上的预填充块之间运行,但调度干扰降低到了大多数生产工作负载可以容忍的水平。对于每秒大约50个请求以下、提示长度适中的工作负载,这个界限已经足够紧凑。