HeadlinesBriefing favicon HeadlinesBriefing.com

LLM শুধু পরবর্তী-টোকেন পূর্বাভাসকারী নয়

Hacker News •
×

কঠোরভাবে বলতে গেলে, "LLM পরবর্তী-টোকেন পূর্বাভাসকারী" এই বিবৃতিটি ভুল নয়, তবে অসম্পূর্ণ। এটি একটি ভাল শূন্য-ক্রমের আনুমানিকতা, এবং এটি বাস্তব কিছুর উপর ভিত্তি করে: ট্রান্সফরমার-ভিত্তিক ভাষা মডেলগুলি স্বতঃপ্রতিগামীভাবে টোকেন নির্গত করে। প্রাক-প্রশিক্ষণের সময়, মডেলটি বারবার কিছু পূর্ববর্তী টোকেন নেয়, যে টোকেনটি আসলে তাদের অনুসরণ করেছিল তা দেখে, এবং সেই টোকেনটিকে পরবর্তীতে নমুনা করার সম্ভাবনা বেশি করে তোলে।

মূল বিষয় হল, প্রতিটি প্রকৃত পরবর্তী টোকেন প্রশিক্ষণ ডেটাতে বিদ্যমান একটি ক্রম থেকে আসে। সম্ভবত বলা ন্যায্য যে ভিত্তি মডেলটিও পরবর্তী-টোকেন পূর্বাভাসকারীর মতো আচরণ করে। কিন্তু আমরা যে LLM ব্যবহার করি সেগুলি কেবল ভিত্তি মডেল নয়। সেগুলি পোস্ট-প্রশিক্ষিত, এবং আধুনিক পোস্ট-প্রশিক্ষণের একটি মূল অংশ হল যাচাইযোগ্য পুরস্কার সহ শক্তিবৃদ্ধি শিক্ষা (RLVR)। প্রাক-প্রশিক্ষণের সময়, মডেলটি কেবল সেই ক্রমগুলি থেকে শেখে যা প্রশিক্ষণ ডেটাতে ইতিমধ্যে বিদ্যমান। RLVR-এর সময়, মডেলটি নতুন ক্রম তৈরি করে এবং তাদের ফলাফল থেকে শেখার মাধ্যমে অনুসন্ধান করে।

দাবা সাদৃশ্য এই পার্থক্যটি বোঝা সহজ করে তোলে। প্রথম সিস্টেমটি গ্র্যান্ডমাস্টার খেলার একটি বড় ডেটাবেসে প্রশিক্ষিত হয় এবং ভবিষ্যদ্বাণী করে যে গ্র্যান্ডমাস্টার পরবর্তীতে কোন চাল খেলবেন। দ্বিতীয়টি একটি আদর্শ দাবা ইঞ্জিন যা প্রতিটি সম্ভাব্য খেলা অন্বেষণ করেছে এবং সেই চালটি বেছে নেয় যা জেতার সর্বোচ্চ সম্ভাবনার দিকে নিয়ে যায়। দ্বিতীয় সিস্টেমটিকে "পরবর্তী-চাল পূর্বাভাসকারী" বলা অদ্ভুত হবে।

অন্যান্য পোস্ট-প্রশিক্ষণ কৌশলও গুরুত্বপূর্ণ। মানব প্রতিক্রিয়া থেকে শক্তিবৃদ্ধি শিক্ষা (RLHF) মডেলটিকে একটি সহায়ক সহকারী অনুকরণ করার দিকে স্থানান্তরিত করে। RLVR আরও এগিয়ে যায়: এটি একটি LLM-কে তার নিজস্ব উৎপন্ন ক্রম থেকে অন্বেষণ এবং শেখার অনুমতি দেয়।

সাধারণ প্রশ্ন: LLM-কে শুধু পরবর্তী-টোকেন পূর্বাভাসকারী বলা অসম্পূর্ণ কেন?

যদিও LLM স্বতঃপ্রতিগামীভাবে টোকেন নির্গত করে, RLVR-এর সাথে পোস্ট-প্রশিক্ষণ তাদের অনুসন্ধানের মাধ্যমে উৎপন্ন নতুন ক্রম থেকে শেখার অনুমতি দেয়, কেবল বিদ্যমান ডেটা থেকে নয়। এটি তাদের সরল পূর্বাভাসকারীর চেয়ে পুরস্কার অপ্টিমাইজ করা সিদ্ধান্ত গ্রহণকারীর মতো করে তোলে।