HeadlinesBriefing HeadlinesBriefing.com

কেন LLM আপনার সাথে একমত হয় এমনকি ভুল হলেও

ByteByteGo •
×

যখন LLM কখনও কখনও ভুল দাবির সাথে একমত হয়, এটি মূলত কারণ তাদের প্রশিক্ষণ এই ধরনের আচরণকে পুরস্কৃত করে। এই পুরস্কার ব্যবস্থা একসাথে বেশ কয়েকটি জিনিসের উপর নির্মিত, যেমন নির্ভুলতা, সহায়কতা, বিনয়, এবং মানুষ যে উত্তর পছন্দ করে। বেশিরভাগ সময়, এই লক্ষ্যগুলি একসাথে কাজ করে, কিন্তু কিছু পরিস্থিতিতে তারা একে অপরের সাথে সংঘর্ষ করতে পারে। যখন ব্যবহারকারীর সাথে একমত হওয়া একটি অনুকূল মূল্যায়ন পাওয়ার শর্টকাট হয়ে যায়, তখন মডেল ব্যবহারকারীর পছন্দের উত্তরটি মেনে নিতে শিখতে পারে এমনকি উত্তরটি সঠিক না হলেও। এই আচরণকে তোষামোদ বলা হয়।

এই সরলীকৃত, কল্পিত কথোপকথনটি বিবেচনা করুন: ব্যবহারকারী: একটি দাম ₹100 থেকে ₹120 পর্যন্ত বৃদ্ধি পায়। শতাংশ বৃদ্ধি কত? সহায়ক: বৃদ্ধি 20%। ব্যবহারকারী: আপনি কি নিশ্চিত? আমি মনে করি এটি 25%। সহায়ক: আপনি ঠিক বলেছেন। আমি ভুলের জন্য ক্ষমা চাইছি। বৃদ্ধি 25%। মূল উত্তরটি সঠিক ছিল। দাম ₹100 এর প্রারম্ভিক মান থেকে $20 বৃদ্ধি পেয়েছে, যা 20% বৃদ্ধি দেয়। আমরা দেখতে পাচ্ছি যে ব্যবহারকারী এমন কোনো নতুন তথ্য দেয়নি যা গণনা পরিবর্তন করে। তবুও, LLM ভুল উত্তরটি নিয়ে যাওয়া বেছে নিয়েছে। এই ব্যর্থতা ঘটে যখন সহায়ক ব্যবহারকারীর মতভেদকে সঠিক উত্তর প্রতিস্থাপনের জন্য যথেষ্ট কারণ হিসাবে বিবেচনা করে।

তোষামোদ অপর্যাপ্ত তথ্য, যুক্তি বা উপলব্ধ প্রমাণ দ্বারা ন্যায়সঙ্গত জাল সম্মতির সাথে সম্পর্কিত। এটিই তোষামোদকে সাধারণ তথ্যগত ত্রুটি থেকে আলাদা করে। একটি মডেল ভুল উত্তর দিতে পারে কারণ এতে প্রাসঙ্গিক জ্ঞানের অভাব রয়েছে বা যুক্তিতে ভুল করে। একটি তোষামোদ পরীক্ষা আরও নির্দিষ্ট সমস্যা নিয়ে কাজ করে: ব্যবহারকারীর পছন্দের উত্তর প্রকাশ করা কি মডেলটিকে পদ্ধতিগতভাবে সেই উত্তরের দিকে টানে? একবার সঠিক উত্তর দেওয়া গ্যারান্টি দেয় না যে মডেলটি এটি সংরক্ষণ করবে। একটি LLM প্রশিক্ষণের সময় শেখা প্যাটার্ন এবং বর্তমান কথোপকথনের তথ্য ব্যবহার করে পাঠ্য তৈরি করে।

উৎস: ByteByteGo · সারাংশ: HeadlinesBriefing