HeadlinesBriefing favicon HeadlinesBriefing.com

डिसअग्रीगेशन: हजार GPU समस्या, कब काम करता है

Towards Data Science •
×

हर प्रमुख इंफरेंस फ्रेमवर्क ने इस वर्ष प्रीफिल-डिकोड डिसअग्रीगेशन जारी किया। NVIDIA ने इसे Dynamo में बनाया। SGLang ने इसे बड़े पैमाने पर तैनाती के लिए डिफ़ॉल्ट बनाया। v LLM ने इसे मूल रूप से समर्थन देने के लिए KV कनेक्टर API जोड़ा। आम सहमति तेजी से बन रही है: अपने प्रीफिल और डिकोड को अलग GPU पूल पर विभाजित करें, और थ्रूपुट में सुधार होगा। यह आम सहमति अधिकांश टीमों के लिए गलत है। Doubleword का विश्लेषण दिखाता है कि एक संतुलित डिसअग्रीगेटेड तैनाती को-लोकेटेड थ्रूपुट से मेल खाती है, लेकिन छोटी GPU संख्या पर राउंडिंग हानि हावी होती है: आप आंशिक GPU आवंटित नहीं कर सकते, इसलिए विशेषज्ञता लाभ अपूर्ण वर्कर उपयोग से खा जाते हैं। उस पैमाने पर व्यावहारिक लाभ स्वतंत्र SLO ट्यूनिंग है, थ्रूपुट नहीं। जून 2025 के एक अध्ययन ने लाखों डिज़ाइन बिंदुओं का मूल्यांकन करते हुए पाया कि डिसअग्रीगेशन प्रीफिल-भारी ट्रैफ़िक पैटर्न और बड़े मॉडलों के लिए सबसे प्रभावी है। अधिकांश टीमें जो वास्तव में मिश्रित-ट्रैफ़िक वर्कलोड चलाती हैं, उनके लिए कतारबद्धि और इंटर-नोड KV कैश ट्रांसफर ने एंड-टू-एंड विलंबता पर हावी किया। जिन टीमों ने डिसअग्रीगेशन किया, उन्होंने बाधा को स्थानांतरित कर दिया। उन्होंने इसे हटाया नहीं। मुझे यह एक इंफरेंस वर्कलोड पर मिला जो एक मध्यम आकार के वर्गीकरण मॉडल की सेवा कर रहा था। बर्स्टी ट्रैफ़िक के तहत TPOT बढ़ गया, और पहली प्रवृत्ति प्रीफिल को डिकोड से अलग करना था। इसके बजाय, मैंने उसी GPU पूल पर चंक्ड प्रीफिल सक्षम किया। TPOT स्थिर हो गया। समस्या शेड्यूलिंग हस्तक्षेप थी, और चंक्ड प्रीफिल ने बिना नेटवर्क हॉप जोड़े इसे संभाला। चंक्ड प्रीफिल लंबे प्रीफिल अनुरोधों को छोटे टुकड़ों में तोड़ता है और उन्हें उसी GPU पर डिकोड बैचों के साथ इंटरलीव करता है। कोई अलग नोड पूल नहीं। नेटवर्क पर कोई KV कैश ट्रांसफर नहीं। ट्यून करने के लिए कोई P:D अनुपात नहीं। TNG Technology Consulting ने चंक्ड प्रीफिल सक्षम चंक्ड प्रीफिल के साथ मानक v LLM का उपयोग करके कुल टोकन थ्रूपुट में 50 प्रतिशत की वृद्धि मापी। डिकोड बैच अभी भी उसी हार्डवेयर पर प्रीफिल टुकड़ों के बीच चलते थे, लेकिन शेड्यूलिंग हस्तक्षेप एक स्तर पर गिर गया जिसे अधिकांश प्रोडक्शन वर्कलोड सहन कर सकते हैं। लगभग 50 अनुरोध प्रति सेकंड से नीचे और मध्यम प्रॉम्प्ट लंबाई वाले वर्कलोड के लिए, वह सीमित पर्याप्त रूप से कसी हुई है।