HeadlinesBriefing favicon HeadlinesBriefing.com

LLM 3x দ্রুত: স্পেকুলেটিভ ডিকোডিং

ByteByteGo •
×

প্রতিটি এজেন্ট ইতিমধ্যে একটি লুপ চালায়। লুপ ইঞ্জিনিয়ারিং এজেন্টের চারপাশে একটি লুপ যোগ করে, যা এটিকে তার আউটপুট মূল্যায়ন করতে, কাজ অপর্যাপ্ত হলে আবার চেষ্টা করতে এবং একই ভুল পুনরাবৃত্তি হলে তার নির্দেশাবলী পরিমার্জন করতে সক্ষম করে। আজ, আপনি সেই ভূমিকা পালন করেন: কাজ পর্যালোচনা করা, কী ভুল হয়েছে তা নির্ণয় করা এবং এজেন্টকে আবার প্রম্পট করা। এই নিবন্ধটি একটি কার্যকর উদাহরণ সহ সেই প্রক্রিয়াটি স্বয়ংক্রিয় করার উপায় দেখায়, পাশাপাশি মানব বিচার এখনও কোথায় প্রয়োজন তা অন্বেষণ করে।

70 বিলিয়ন প্যারামিটার বিশিষ্ট একটি মডেলের GPU মেমরি থেকে প্রায় 140 GB ওজন পড়ার প্রয়োজন হয়। আধুনিক ডেটা সেন্টার GPU-তে, এই স্থানান্তর কয়েক দশ মিলিসেকেন্ড নিতে পারে। এই ওজনের উপর প্রয়োগ করা প্রকৃত গণনা সেই সময়ের একটি ভগ্নাংশ নেয়। এর অর্থ হল প্রসেসরের গণিত ইউনিটগুলি টোকেন জেনারেশন ধাপে নেওয়া সময়ের বেশিরভাগ সময় অব্যবহৃত থাকে। স্পেকুলেটিভ ডিকোডিং একটি কৌশল যা এই অব্যবহৃত ক্ষমতাকে আউটপুটে রূপান্তর করে।

একটি দ্বিতীয়, অনেক ছোট মডেল আগে থেকেই বেশ কয়েকটি প্রার্থী টোকেন উত্পাদন করে। বড় মডেলটি একটি একক ফরোয়ার্ড পাসে তাদের সব মূল্যায়ন করে, প্রতি টোকেনে একটি পাসের পরিবর্তে, ফলে 2-3 গুণ দ্রুত জেনারেশন হয়। আরও ভালো কথা, উত্পাদিত পাঠ্যটি একা চলমান বড় মডেলের আউটপুটের সাথে পরিসংখ্যানগতভাবে অভিন্ন থাকে।

টেক্সট জেনারেশন একবারে একটি টোকেন কাজ করে। মডেলটি এখন পর্যন্ত উত্পাদিত সবকিছু পড়ে, তার শব্দভান্ডারের উপর সম্ভাব্যতা বন্টন গণনা করে, পরবর্তী টোকেন নির্বাচন করে, সেই টোকেনটি ইনপুটে যুক্ত করে এবং চক্রটি পুনরাবৃত্তি করে। প্রতিটি চক্রকে ফরোয়ার্ড পাস বলা হয়, এবং প্রতিটি ফরোয়ার্ড পাস ইনপুটটিকে মডেলের সমস্ত স্তরের মাধ্যমে চালায়। আধুনিক ইনফারেন্স সিস্টেমগুলি KV ক্যাশ ব্যবহার করে, যা ইতিমধ্যে প্রক্রিয়াকৃত টোকেনগুলির জন্য মনোযোগের অবস্থা সঞ্চয় করে, প্রতিটি পাসের ভিতরে কাজ হ্রাস করে, যদিও প্রতি টোকেনে একটি পাসের প্রয়োজনীয়তা এখনও থাকে।

মূল সত্তা: কোম্পানি: ByteByteGo