HeadlinesBriefing favicon HeadlinesBriefing.com

LLM-এর জন্য RL: ম্যাথিউ এফেক্ট এবং কখনও হাল ছাড়বেন না

Hacker News •
×

এই ব্লগ পোস্টটি LLM-এর RL পোস্ট-ট্রেনিং নিয়ে একটি পেপার আলোচনা করে, ম্যাথিউ এফেক্ট উপস্থাপন করে এবং এটি সমাধানের জন্য 'কখনও হাল ছাড়বেন না' প্রস্তাব করে। লেখক ইন্টারঅ্যাকটিভভাবে উপস্থাপন করেন, পেপার এবং কোডে আরও গভীর প্রযুক্তিগত বিবরণ রয়েছে।

প্রতিটি RL অনুশীলনকারী একটি eval কার্ভ উপরে উঠতে দেখেছেন, যেমন Olmo 3.1 RL-Zero Math-এর প্রশিক্ষণের সময় AIME 2025। কিন্তু এর মানে কী? 30টি AIME প্রশ্নকে প্রাথমিক pass@32-এর ভিত্তিতে কঠিনতার স্তরে ভাগ করলে, আমরা দেখতে পাই সহজ সমস্যাগুলি নাটকীয়ভাবে উন্নত হয়, যখন কঠিন সমস্যাগুলি (প্রাথমিক pass@32=0) প্রায় উন্নত হয় না। গড় এটি লুকিয়ে রেখেছিল: লাভ সহজ সমস্যাগুলি থেকে আসে। এটি ম্যাথিউ এফেক্ট।

আমরা Deepcoder এবং Deep SWE ব্যবহার করে কোড RL এবং এজেন্টিক RL-এ অনুরূপ দেখতে পাই। লাভ প্রাথমিক দক্ষতার সমানুপাতিক। আমরা এটিকে নেটওয়ার্ক সায়েন্স এবং অর্থনীতিতে ম্যাথিউ এফেক্টের সাথে সংযুক্ত করি: 'ধনী আরও ধনী হয়'। LLM-এর জন্য RL-এ ম্যাথিউ এফেক্ট: RL প্রাথমিক দক্ষতার অনুপাতে পারফরম্যান্স উন্নত করে—সহজ কাজগুলি সহজ হয়ে যায়, কঠিন কাজগুলি কঠিন থেকে যায়।

কারণ? শুধু GRPO নয়। যদি k নমুনায় কোনো সঠিক উত্তর না থাকে, তাহলে কোনো গ্রেডিয়েন্ট নেই। একটি সমাধান: আরও কমপ্লিশন স্যাম্পল করুন (বড় k)। আমরা GSM8k platinum-এ Qwen 2.5 0.5B Instruct দিয়ে পরীক্ষা করি, k পরিবর্তন করে।