HeadlinesBriefing favicon HeadlinesBriefing.com

LLM इन्फरेंस सर्वर क्यों VRAM से बाहर चलते हैं

Towards Data Science •
×

एक मध्यम आकार के मॉडल के वजन आराम से फिट होते हैं, फिर भी समवर्ती ट्रैफ़िक ने CUDA आउट-ऑफ-मेमोरी त्रुटियों को ट्रिगर किया जबकि GPU उपयोग कम रहा। की-वैल्यू कैश, मॉडल आकार नहीं, हेडरूम खा गया। GPU जोड़ने से पहले, लेखक ने पेज्ड आवंटन और प्रीफ़िक्स कैशिंग सक्षम किया, सीमा बढ़ाई और एक मेमोरी-लेआउट समस्या को उजागर किया।

निवेश सेवा स्टैक अधिकतम अनुक्रम लंबाई के लिए प्रति अनुरोध एक सतत ब्लॉक आरक्षित रखते हैं। 4,096-टोकन आरक्षण के खिलाफ 200 टोकन उत्पन्न करने वाला अनुरोध अधिकांश भाग अप्रयुक्त छोड़ देता है। v LLM विश्लेषण में पाया गया कि naïve KV कैश प्रबंधन आरक्षित मेमोरी का 60 से 80 प्रतिशत बर्बाद करता है। कैश समवर्ती अनुरोधों के साथ बढ़ता है, इसलिए ट्रैफ़िक स्पाइक — लंबे प्रॉम्प्ट नहीं — सर्वर को मेमोरी क्लिफ से आगे धकेलते हैं।

GPU मेमोरी स्थिर मॉडल वजन, अस्थायी एक्टिवेशन और चर KV कैश द्वारा साझा की जाती है। Llama 3.1 70B के BF16 में प्रत्येक टोकन की लागत लगभग 320 KB होती है, जिसमें 80 लेयर, 8 की/वैल्यू हेड और हेड डायमेंशन 128 होता है। समूहित क्वेरी अटेंशन की/वैल्यू हेड की संख्या और कैश आकार कम करती है।

128 समवर्ती अनुरोध जो 4K-टोकन संदेश रखते हैं, केवल कैश को लगभग 160 GB की आवश्यकता होती है। 70B वजन BF16 में 140 GB की आवश्यकता होती है, इसलिए कैश मॉडल से बड़ा हो सकता है। v LLM कैश को अधिकतम समवर्ती अनुक्रमों के अधिकतम अनुक्रम लंबाई के गुणनफल के रूप में आरक्षित रखता है; cualquiera को बढ़ाने से आरक्षण गुणा हो जाता है और स्टार्टअप OOM को ट्रिगर कर सकता है।

मुख्य इकाइयाँ: कंपनियाँ: NVIDIA, Towards Data Science