HeadlinesBriefing favicon HeadlinesBriefing.com

পারমুটেশন সিমেট্রি নিউরাল নেটওয়ার্ক গড় ভেঙে দেয়

Towards Data Science •
×

আপনি যদি কখনও একই ডেটাতে একই আর্কিটেকচার দুবার প্রশিক্ষণ দিয়ে নিউরাল নেটওয়ার্ক ওজন গড় করার চেষ্টা করেছেন, শুধুমাত্র র্যান্ডম সিড পরিবর্তন করে, আপনি সম্ভবত ধরে নিয়েছেন যে দুটি ফলাফল মূলত বিনিময়যোগ্য। উভয় রান কনভার্জ করে। উভয়ই একই লসে পৌঁছায়। তাই আপনি দুটি ওজন ভেক্টরের গড় নেন, আশা করে যে এটি অন্তত একা যেকোনোটির মতো ভাল হবে। গড়টি খারাপ। প্রায়শই অনেক খারাপ। প্রশিক্ষণ প্রক্রিয়ার সময় কোনো সমস্যা ছিল না; এটি নিউরাল নেটওয়ার্কের একটি কাঠামোগত বৈশিষ্ট্য এবং সরাসরি পারমুটেশন সিমেট্রি নামে পরিচিত একটি বৈশিষ্ট্য থেকে অনুমান করা যেতে পারে।

একই নীতিটি ব্যাখ্যা করে কেন মডেল মার্জিং সফল হয় যখন এটি সফল হয় এবং ব্যর্থ হয় যখন এটি ব্যর্থ হয়, একটি প্রশ্ন যা 2026 সালে ব্যবহারিক LLM ইঞ্জিনিয়ারিংয়ের কেন্দ্রে রয়েছে, কেউ মডেল স্যুপ বা ফেডারেটেড গড় নিয়ে কাজ করুক না কেন। দুটি প্রশিক্ষিত নেটওয়ার্ককে দুটি স্প্রেডশিট হিসাবে ভাবুন যা একই রিপোর্ট বর্ণনা করে, শুধুমাত্র কলামগুলি ভিন্ন ক্রমে। মডেল A-এর "কলাম 3"-এ যা থাকতে পারে তা মডেল B "কলাম 7" বলে। উভয় স্প্রেডশিট সঠিক। কিন্তু প্রথমে কলামগুলি সারিবদ্ধ না করে সেল বাই সেল গড় নেওয়া, রাজস্বকে কর্মচারী সংখ্যার সাথে গড় নেওয়ার মতো।

বেশিরভাগ নিউরাল নেটওয়ার্ক পরিচিতি ফাংশন স্পেসে থাকে। এই নিবন্ধটি প্যারামিটার স্পেসে থাকে: ভাল সমাধানের সেটটি আসলে কেমন দেখায় এবং সেই জ্যামিতি আপনাকে কী খরচ দেয়। ক্লাসিক মডেল যেমন পলিনোমিয়াল রিগ্রেশনের নির্দিষ্ট বেস ফাংশন এবং কনভেক্স লস থাকে। একটি নিউরাল নেটওয়ার্ক বেস ফাংশন নিজেই শেখে, যা লসকে নন-কনভেক্স করে তোলে। এই নন-কনভেক্সিটি হলো অভিযোজনযোগ্যতার মূল্য। বেস ঠিক করুন, এবং আমরা কনভেক্সিটি পাই। বেস শিখুন, এবং আমরা এটি হারাই। কোনো তৃতীয় বিকল্প নেই।