HeadlinesBriefing favicon HeadlinesBriefing.com

LLM ইনফারেন্স সার্ভার কেন VRAM থেকে বের হয়ে যায়

Towards Data Science •
×

একটি মাঝারি আকারের মডেলের ওজন আরামে ফিট হয়, তবে সমবেত ট্রাফিক CUDA আউট-অফ-মেমোরি ত্রুটি ট্রিগার করে जबकि GPU ব্যবহার কম থাকল। কী-ভ্যালু ক্যাশ, মডেল আকার নয়, হেডরুম খেয়ে গেল। GPU যোগ করার আগে, লেখক পেজ্ড অ্যালোকেশন এবং প্রিফিক্স ক্যাশিং সক্ষম করেছে, সীমা বাড়িয়ে দিয়েছে এবং একটি মেমোরি-লেআউট সমস্যা উন্মোচন করেছে।

নাইভ সার্ভিং স্ট্যাক সর্বোচ্চ অনুক্রম দৈর্ঘ্য জন্য প্রতিটি অনুরোধের জন্য একটি সতত ব্লক rezerv করে। 4,096-টোকেন রিজার্ভেশনের বিরুদ্ধে 200 টোকেন উৎপন্ন করে এমন একটি অনুরোধ এর অধিকাংশ অপ্রयुक्त রাখে। v LLM বিশ্লেষণে পाया গেছে যে naïve KV ক্যাশ ম্যানেজমেন্ট রিজার্ভড মেমোরির 60 থেকে 80 শতাংশ বर्बাদ করে। ক্যাশ সমবেত অনুরোধের সাথে বৃদ্ধি পায়, তাই ট্রাফিক স্পাইক — দীর্ঘ প্রম্পট নয় — সার্ভারকে মেমোরি ক্লিফের পাশে ধकेলে।

GPU মেমোরি স্থির মডেল ওজন, অস্থায়ী একটিভেশন এবং পরিবর্তনশীল KV ক্যাশ দ্বারা ভাগ করা হয়। Llama 3.1 70B-এর BF16-এ প্রতিটি টোকেনের খরচ تقریباً 320 KB, যার 80 স্তর, 8 কী/ভ্যালু হেড এবং হেড ডাইমেনশন 128। গ루পড-কোয়ারি আটেনশন কী/ভ্যালু হেডের সংখ্যা এবং ক্যাশের আকার কমায়।

128 সমবেত অনুরোধ যা 4K-টোকেন কনটেক্সট ধরে রাখে, শুধু ক্যাশের জন্য تقریباً 160 GB দরকার। 70B ওজন BF16-এ 140 GB দরকার, তাই ক্যাশ মডেলের চেয়ে বড় হতে পারে। v LLM ক্যাশকে সর্বোচ্চ সমবেত অনুক্রমের সংখ্যা গুণ সর্বোচ্চ অনুক্রম দৈর্ঘ야 হিসেবে rezerv করে; যে কোনো একটি বাড়ালে rezerv গুণিত হয় এবং স্টার্টআপ OOM ট্রিগার করতে পারে।

মূল entidades: কোম্পানিগুলো: NVIDIA, Towards Data Science