HeadlinesBriefing favicon HeadlinesBriefing.com

RLCD কী? Jev-এর পিছনের রহস্য

Hacker News •
×

পেয়ারওয়াইজ রিওয়ার্ড মডেলিং থেকে ক্যালিব্রেটেড, মাল্টিওয়ে সিদ্ধান্ত পর্যন্ত, Jev একটি ভাষা মডেলের বিকল্প হিসেবে দেখলে রহস্যময় মনে হয়। যখন এটিকে রিওয়ার্ড মডেলিংয়ের পরবর্তী ধাপ হিসেবে দেখা হয় তখন এটি অনেক সহজ হয়ে যায়। মূল ধারণাটি হল: RLCD = মাল্টিওয়ে পছন্দ মডেলিং + সম্ভাবনা ক্যালিব্রেশন। আরও নির্দিষ্টভাবে, RLCD একটি স্কিমা-শর্তযুক্ত Plackett–Luce লক্ষ্য। Jev টাইপকৃত আউটপুট এবং সমান্তরাল অনুমান যোগ করে সেই লক্ষ্যকে একটি পণ্যে পরিণত করে। এটাই রহস্য: রিওয়ার্ড মডেল আর জেনারেটরের পিছনে লুকানো নেই। রিওয়ার্ড মডেল নিজেই মডেল হয়ে যায়।

রিওয়ার্ড মডেলিং একটি স্কেলার দিয়ে শুরু হয়েছিল। একটি প্রচলিত রিওয়ার্ড মডেল একটি প্রসঙ্গ এবং একটি প্রার্থী উত্তর গ্রহণ করে, তারপর একটি স্কেলার উৎপন্ন করে। ফলাফল রিওয়ার্ড মডেল চূড়ান্ত উত্তরকে স্কোর করে। প্রক্রিয়া রিওয়ার্ড মডেল পৃথক যুক্তির ধাপগুলিকে স্কোর করে। উভয় ক্ষেত্রেই, শেখা বস্তুটি একটি পরম-দেখানো সংখ্যা। সমস্যা হল এই সংখ্যাটি আসলে পরম নয়। 0.8-এর একটি রিওয়ার্ড সমস্যা, প্রার্থী পুল, চেকপয়েন্ট বা মডেল পরিবার জুড়ে একটি স্থিতিশীল অর্থ রাখে না। এটি মূলত অনুরূপ অবস্থার অধীনে উৎপন্ন প্রার্থীদের তুলনা করার জন্য উপযোগী। অপারেশনাল সংকেত সর্বদা আপেক্ষিক পছন্দ ছিল।

PPRM পছন্দকে স্পষ্ট করেছে। LLaMA-Berry-এর পেয়ারওয়াইজ প্রেফারেন্স রিওয়ার্ড মডেল, বা PPRM, সরাসরি তুলনা প্রকাশ করে। একটি সমস্যা এবং দুটি সমাধান দেওয়া হলে, PPRM উত্তর দেয়: প্রথম উত্তরটি কি দ্বিতীয় উত্তরটির চেয়ে ভাল? এটি Bradley–Terry মডেল। LLaMA-Berry তুলনাটিকে হ্যাঁ এবং না টোকেনের উপর একটি সীমাবদ্ধ ভাষা-মডেল সিদ্ধান্ত হিসাবে প্রয়োগ করে। এটি প্রায় 7.8 মিলিয়ন গাণিতিক-সমাধান জোড়ায় মূল্যায়নকারীকে প্রশিক্ষণ দেয় এবং পেয়ারওয়াইজ ভবিষ্যদ্বাণী কাজ উন্নত করতে DPO ব্যবহার করে। প্রয়োজনীয় পরিবর্তনটি ধারণাগত: রিওয়ার্ড মডেলিং পছন্দ-সম্ভাবনা মডেলিংয়ে পরিণত হয়।

Plackett–Luce হল মাল্টিওয়ে PPRM। PPRM দুটি প্রার্থীর তুলনা করে। একটি বাস্তব সিদ্ধান্ত ইন্টারফেস সাধারণত দুটির বেশি গ্রহণ করে। প্রতিটি প্রার্থীকে একটি প্রসঙ্গ-নির্ভর উপযোগিতা নির্ধারণ করুন, তারপর সমস্ত প্রার্থীকে একসাথে স্বাভাবিক করুন। এটি Luce চয়েস মডেল, যা মাল্টিনোমিয়াল লজিট নামেও পরিচিত। যখন K=2, এটি ঠিক Bradley–Terry-তে হ্রাস পায়। তাই PPRM একই চয়েস জ্যামিতির বাইনারি ক্ষেত্রে। যদি তত্ত্বাবধানে একটি সম্পূর্ণ র্যাঙ্কিং থাকে, তাহলে সম্পূর্ণ Plackett–Luce সম্ভাবনা বারবার পরবর্তী সেরা অবশিষ্ট প্রার্থী নির্বাচন করে।

মূল সত্তা: কোম্পানি: LLaMA-Berry