HeadlinesBriefing favicon HeadlinesBriefing.com

অসীম-প্যারামিটার LLM: লাইভ ডেটা থেকে ওজন

Hacker News •
×

স্কেলিং আইন বলে যে একটি ভাষা মডেল আরও প্যারামিটার এবং প্রশিক্ষণ ডেটার সাথে আরও সক্ষম হয়। মিক্সচার-অফ-এক্সপার্টস (MoE) আর্কিটেকচার এই আইনগুলি অনুসরণ করে উল্লেখযোগ্য ফলাফল অর্জন করেছে, প্রতি টোকেনে বিশাল সঞ্চিত প্যারামিটার ব্যাঙ্কের একটি ক্ষুদ্র অংশ সক্রিয় করে।

এই সাফল্য স্থির প্রিট্রেনিং ডেটার উপর নির্মিত। একটি স্থাপিত মডেল ভিন্ন একটি জগতের মুখোমুখি হয়, যেখানে এটিকে আরও উপযোগী করে তুলতে পারে এমন অনেক ডেটা এর প্রশিক্ষণ সেটে নয়, বরং এটি বর্তমানে যে লাইভ ইন্টারঅ্যাকশন পরিচালনা করছে তাতে থাকে, যেমন ব্যবহারকারীর দেওয়া তথ্য বা তাদের দেওয়া সংশোধন। একটি প্রচলিত মডেল এই ডেটা থেকে শিখতে পারে না, কারণ এর ওজন প্রশিক্ষণের পরে জমে যায়। পরিবর্তে, রান টাইমে সরবরাহ করা জ্ঞান এবং আচরণ প্রম্পটে রাখা হয় এবং অনুরোধ শেষ হলে বাতিল করা হয়।

আমরা জিজ্ঞাসা করি কীভাবে একটি আর্কিটেকচার লাইভ ইন্টারঅ্যাকশনকে তার ওজনে লিখে তা থেকে শিখতে পারে। MoE থেকে অনুপ্রেরণা নিয়ে, আমরা অসীম-প্যারামিটার LLM প্রস্তাব করি। একটি কম্প্যাক্ট হাইপারনেটওয়ার্ক রান-টাইম ডেটাকে একটি শেয়ার্ড বেস নেটওয়ার্কের লো-র্যাঙ্ক মডুলেশনে রূপান্তর করে, তাই ফিড-ফরওয়ার্ড ওজন লাইভ ডেটা থেকে তৈরি হয়, স্থির ব্যাঙ্কে সংরক্ষিত হয় না। যেখানে পূর্ববর্তী ওজন জেনারেটরগুলি প্রসঙ্গ একবার পড়ে এবং জমে যায়, সেখানে আমরা জেনারেটরের লেটেন্ট কোডের উপর একটি বায়েসিয়ান বিশ্বাস বহন করি এবং এটি অনলাইনে আপডেট করি।

সঞ্চিত ফুটপ্রিন্ট স্থির থাকে, তবুও মডেল যে ওজন কম্পাইল করতে পারে তা কার্যত অসীম। রান-টাইম জ্ঞান প্রম্পটের পরিবর্তে ওজনে বহন করা গণনায় অ্যামোর্টাইজড হয়, কনটেক্সট উইন্ডো মুক্ত করে, টার্ন জুড়ে স্থায়ী হয় এবং আরও ভালভাবে সাধারণীকরণ করতে পারে। আমরা একটি মূল্যায়ন প্রোটোকল নির্দিষ্ট করি যা এটি ইন-কনটেক্সট লার্নিং এবং রিট্রিভালের বিরুদ্ধে পরীক্ষা করে।

মূল সত্তা: ব্যক্তি: Jinli Hu