HeadlinesBriefing favicon HeadlinesBriefing.com

LLM বিচারকদের একমততা: কি বিশ্বাসযোগ্য? Ising মডেল

Hacker News •
×

কল্পনা করুন একটি পুনরুদ্ধার-বর্ধিত-উৎপাদন সিস্টেম মূল্যায়ন করা হচ্ছে যেখানে একাধিক LLM বিচারক একই প্যাসেজটি মূল্যায়ন করছেন। আটজন 'প্রাসঙ্গিক' বলেন; দুজন 'প্রাসঙ্গিক নয়' বলেন। দশজন থেকে আটজন খুবই আশ্বস্তকারী মনে হয়, কিন্তু একমততার শক্তি বিচারকদের স্বাধীনতায় নির্ভর করে। যদি বিচারকরা প্রম্পট টেমপ্লেট, প্রশিক্ষণ বংশাবলী, মডেল পরিবার, বা ব্লাইন্ড স্পট শেয়ার করেন, তবে তারা একই ভুলটি পুনরাবৃত্তি করতে পারে, যা ভোট গণনাকে বিভ্রান্তিকরভাবে শক্তিশালী করে তোলে। 'Ising মডেলের মাধ্যমে LLM-অ্যাজ-এ-জাজের জন্য নির্ভরতা-সচেতন লেবেল সমষ্টিবদ্ধকরণ' शीর্ষক পেপারটি, Shiva Kasiviswanathan-এর সাথে সহ-লিখিত এবং ICML-এ উপস্থাপিত, বিচারকদের আউটপুটের মধ্যে tươngসর্গগুলি মূল্যায়ন করার এবং মতামতের বৈচিত্র্য নিশ্চিত করতে সমষ্টিগত স্কোরগুলি সমন্বয় করার একটি পদ্ধতি উপস্থাপন করে। তিনটি কাজের পরীক্ষায়, এই পদ্ধতিটি সেরা-নिष্পাদনকারী বেসলাইন — ঐতিহাসিক নির্ভুলতা দ্বারা ওজনযুক্ত একটি প্যানেল — কে মানক মেট্রিকসে ৯% থেকে ১৪% পর্যন্ত পিছিয়ে দিয়েছে। több số ভোট অনুমান করে যে বিচারকরা স্বাধীনভাবে ত্রুটি করেন, যা LLM-অ্যাজ-এ-জাজ সিস্টেমের জন্য প্রায়শই অত্যধিক আশাবাদী। দুজন বিচারক একই রুব্রিক ব্যাখ্যা, শেয়ার করা প্রম্পট উদাহরণ, বা শেয়ার করা মডেল সংবেদনশীলতার কারণে একসাথে ব্যর্থ হতে পারেন। সমষ্টিবদ্ধকারী প্যানেলটিকে একটি নেটওয়ার্ক হিসেবে মডেল করে যেখানে প্রতিটি বিচারকের একটি নির্ভরযোগ্যতা প্রোফাইল থাকে এবং জোড়াগুলোর সম্পর্ক থাকে, যারা অনুমানের চেয়ে বেশিবার একমত হন বা পূরক দৃষ্টিভঙ্গি প্রদান করেন। এই পদ্ধতিটি Ising মডেল ব্যবহার করে বিচারকের দক্ষতা এবং সাদৃশ্য মডেল করে, একটি পরিসংখ্যান মডেল যা বাইনারি ভেরিয়েবলগুলির মধ্যে জোড়া নির্ভরতা উপস্থাপন করে। দুটি মডেলিং ভেরিয়েন্ট রয়েছে: একটি ধনাত্মক এবং ঋণাত্মক লেবেল জুড়ে সম্পর্কের প্যাটার্নগুলিকে সামঞ্জস্যপূর্ণ मानে, tươngসর্গের জন্য ওজন সমন্বয় করে; অন্যটি, একটি ক্লাস-নির্ভর মডেল, লেবেলের সাথে সম্পর্কের প্যাটার্ন পরিবর্তন করার অনুমতি দেয়, যা উপযোগী যখন বিচারকরা স্পষ্ট আইটেমগুলিতে একমত হন কিন্তু অস্পষ্ট مواردে গুচ্ছায়। এই অপরিবেক্ষিত পদ্ধতিটি মানব রেফারেন্স লেবেল ছাড়াই বিচারক আউটপুট থেকে শেখে, সত্য লেবেলগুলিকে গুপ্ত ভেরিয়েবল হিসেবে বিবেচনা করে বিচারকের নির্ভরযোগ্যতা এবং নির্ভরতা যৌথভাবে অনুমান করে।