HeadlinesBriefing favicon HeadlinesBriefing.com

GRPO ছোট ভাষা মডেল

Towards Data Science •
×

এক ভাষা মডেল 'let me double-check that' লিখতে পারে কিন্তু গুণন错仍然 হতে পারে। এটি 'wait, let me reconsider,' লিখতে পার এবং ভুল উত্তর দিতে পার। এই兩句话 কেউ চিন্তার প্রমাণ নहीं। যদি লক্ষ্য সমস্যা সমাধান করা হয়, তবে শুধু শেষের সংখ্যাই গণনা হয়। Deep Seek's R1-Zero 강화 শিক্ষা কে পূর্বে কোনো সুপারভাইজড ফাইন-টিং স্টেজ ছাড়া গুরুত্বপূর্ণ মনোযোগ আকর্ষণ করেছে। এর গবেষকরা প難題ে পুনঃপুনঃ পৌঁছানোর এবং কঠিন সমস্যার জন্য বেশি টোকেন ব্যবহার করারような আচরণের রিপোর্ট দিয়েছে। Deep Seek-R1, বিপরীতভাবে, broader training pipeline ব্যবহার করেছে, cold-start ডেটা 포함 করে, তাই আমাদের দুটি প্রশিক্ষণ প্রক্রিয়াকে互换able বলতে shouldn't। GRPO-এ আমাদের সবচেয়ে বেশি কী আকর্ষণ করে তা হলো মৌলিক সেটআপ কে কত কম ফিডব্যাক লাগে। মডেল প্রশ্নের জন্য একাধিক প্রস্তুতি তৈরি করতে পারে, প্রতিটি জন্য স্কোর পেতে পারে, এবং আচরণ পরিবর্তন করতে পারি। আমাদেরাও উত্তর যাচাই করতে পারি না যে সমাধান লিখতে হবে যা এটি অনুকরণ করবে। প্রশিক্ষণ মেমোরি কম করার টেকনিকের সাথেgabungan, ছোট যুক্তি অভিজ্ঞতা আরও অ্যাক্সেসযোগ্য হবে। দুটি বিষয় আছে যা মডেল বা GPU নির্বাচন করার আগে বোঝা যাক: স্কোর কীভাবে আপডেট গাইড করে, এবং যখন স্কোরিং রুল গলত কিছু পুরস্কার দেয়, তবে কী ঘটে। একটি সহজ অঙ্কমতম উদাহরণ দুটি বিষয়টি ব্যাখ্যা করতে সাহায্য করবে। একই প্রশ্নের চার সম্ভাব্য উত্তর বিবেচনা করুন এবং একটি reward function কীভাবে প্রতিটি একটি স্কোর দেয়। একটি যাচাইযোগ্য উত্তর সহ সমস্যা: একটি দোকান আছে 6 বক্সে 8 আইটেমে প্রতিটি বক্সে। 6 আইটেম বিক্রি করা। কত আইটেম বাকি থাকবে? উত্তর 42। একটি Python expression যাচাই করতে পারে। এখন, এই সহজ যাচাই আমাদের কিছু valuable দেয়: উত্তর যাচাই করার জন্য স্বাধীন একটি পদ্ধতি। আমাদের আরেক ভাষা মডেলের প্রয়োজন নहीं যাক যে নির্ধারণ করবে উত্তর কি কনভিন্সিং লাগছে। প্রশিক্ষণ ডেটাসেটে, প্রশ্ন মডেলে যাবে যখনxpected answer যাচাইকারী সাথে থাকবে। মডেল উত্তর তৈরি করবে, যাচাইকারী স্কোর করবে, এবং প্রশিক্ষণ algoritmo মডেলের আচরণ পরিবর্তন করতে skor ব্যবহার করবে। সহজ। তাই আমরা সুপারভাইজড টার্গেট হিসেবে কাজে লাগানো solved solutions ছাড়া প্রশ্ন-উত্তর জড়িত ব্যবহার করতে পারি। যাচাইযোগ্য পুরস্কার সহ reinforcement learning এর আকর্ষণ হলো: ফিডব্যাক outcome যাচাই থেকে আসবে। একটি reales inventory system জন্য, অঙ্কমতম অঙ্কমতম এখনও সুনির্দিষ্ট সমাধান। ভাষা মডেল একটি costly calculator মতামতের সাথে। এখানে, উদাহরণ শিক্ষা mekanism কে সহজে inspeksi করতে সাহায্য করে। এটিও আমাদের যাচাইকারী কে যেখানে গলত পড়ে সেটি দেখায়, কারণ শেষ integer যাচাই করলে আমাদের বুঝতে হবে কি যুক্তি বোধগম্য। GRPO Deep Seek Math কাজে conventional PPO-ভিত্তিক প্রশিক্ষণের alternative হিসেবে介绍 করা হয়েছে, memory requirements সমাধান করে। সাধারণ actor-critic PPO implementations value estimator train, often called a critic, alongside the policy. That estimator supplies a baseline for judging an action’s outcome. GRPO apne baseline same prompt ke liye sampled responses ke group se obtain karta hai। sirf doosre critic se poochne ke baare mein ki model kaise karna chahiye, it compares how well several attempts actually did.

Imagine model yeh char answers produce karta hai: Attempt Final answer Correctness reward 1 42 1, 2 24 0, 3 42 1, 4 48 0. Group ki average reward 0.5 hai. Attempts 1 aur 3 us average se behtar performance diye; attempts 2 aur 4 se behtar nahi.

Original outcome-reward formulation standardizes that comparison: [Ai=ri−rˉσr+ϵ]. Yeh dikhata hai ki attempts 1 aur 3 ka standardized reward 0 se upar hai, jabki attempts 2 aur 4 ka standardized reward 0 se neeche hai. Is tarah, GRPO ek group of responses ke comparison ka use karta hai model update guide karne ke liye, bina koi external critic ke.