HeadlinesBriefing favicon HeadlinesBriefing.com

স্থানীয় LLM কেন কম রেন্ডার করে

Hacker News •
×

আমরা সবাই একটি “AMAZEBALLZ” মডেল ডাউনলোড করি উচ্চ পারফরম্যান্সের আশায়, কিন্তু প্রায়ই দেখি আমাদের লোকাল সেটআপ খারাপ চলছে। এই ব্যবধান ইনফারেন্স চলাকালীন ইমপ্লিমেন্টেশন-নির্দিষ্ট ঝুঁকির কারণে হয়। রেফারেন্স ল্যাবের হার্ডওয়্যার ও সফটওয়্যার ঘরের রিগ থেকে সম্পূর্ণ ভিন্ন। প্রতিটি GPU জেনারেশন পরবর্তী টোকন গণনা করে ভিন্নভাবে, যা প্রকাশিত দাবি থেকে স্বাভাবিক বিচ্যুতি তৈরি করে।

আপনার সেটআপের বাস্তব ক্ষমতা পরিমাপ করতে terminal bench, hle, SWEthis, HELLAthat বা MMLU-whatever এর মতো স্ট্যান্ডার্ড বেনচমার্ক চালান। জিরো-শট টেস্ট এড়িয়ে চলুন; এজেন্টিক টাস্কের জন্য লং-কন্টেক্সট টুল-কলিং প্রয়োজন। স্যাম্পলার সেটিংস বরাবর মিলিয়ে নিন। @wendell বলেছিলেন, গণিত গণিতই থাকে। মডেল কার্ডের ডিফল্ট মান ব্যবহার করুন: সাধারণত temp 1.0 এবং top-p 0.95। ভুল তাপমাত্রা লুপ তৈরি করে, আর অমিল স্যাম্পলার সম্ভাবনাগুলো বিকৃত করে, ফলে আউটপুট অস্বাভাবিক লাগে।

গাণিতিক দৃষ্টিকোণ থেকে, KLD (KL Divergence) ট্র্যাক করুন। লগিটকে সম্ভাবনা বিন্যাসে রূপান্তর করুন এবং বেসলাইন থেকে বিচ্যুতি মেপুন। কম KLD এর অর্থ ভালো বুদ্ধিমত্তা নয়, বরং কাছাকাছি অ্যালাইনমেন্ট। কোনো রেফারেন্স চেকপয়েন্ট ছাড়া কোয়ান্টাইজড HF মডেলে অস্বাভাবিকভাবে কম স্কোরের উপর বিশ্বাস করবেন না। সম্পূর্ণ রানটাইম এনভায়রনমেন্ট ছাড়া কম স্কোরের ফাঁদে পড়বেন না। প্রতিনিধিত্বমূলক টেস্ট চালান, চ্যাট টেমপ্লেট মিলিয়ে নিন এবং মেনে নিন যে আজকের প্রতিটি LLL ইনস্ট্যান্স সামান্য ভিন্নভাবে কাজ করে।