HeadlinesBriefing favicon HeadlinesBriefing.com

ছোট নেটওয়ার্ক ডেটা সংকুচিত করে, পেন্টাগনকে আকর্ষণ করে

Towards Data Science •
×

আমি আশা করিনি যে জ্যামিতি দেখা দেবে। আমি Anthropic-এর 2022 সালের ব্যাখ্যাযোগ্যতা পেপার, "টয় মডেলস অফ সুপারপজিশন" [1]-এর একটি ছোট অংশ পুনরুত্পাদন করছিলাম, প্রধানত কারণ কেন্দ্রীয় দাবিটি এতটাই অবিশ্বাস্য শোনাচ্ছিল যে আমি এটি বিশ্বাসের উপর নেওয়ার পরিবর্তে নিজেই যাচাই করতে চেয়েছিলাম। দাবি: একটি নিউরাল নেটওয়ার্ক তার কাজ করার মাত্রার চেয়ে বেশি বৈশিষ্ট্য উপস্থাপন করতে পারে, সেগুলিকে একে অপরের সাথে কোণে প্যাক করে এবং কিছুটা হস্তক্ষেপ সহ্য করে। সঠিক অবস্থার অধীনে এটিকে পাঁচটি জিনিসকে দুই মাত্রায় সংকুচিত করতে বলুন, এবং এটি দুটি বিজয়ী বেছে নেয় না এবং বাকিগুলি ছেড়ে দেয় না। এটি পাঁচটিকে একটি নিখুঁত পঞ্চভুজে সাজায়। আমার কাছে PyTorch বা কোনো অটোগ্র্যাড লাইব্রেরি উপলব্ধ ছিল না, এবং একটি ইনস্টল করার জন্য ইন্টারনেট অ্যাক্সেসও ছিল না, তাই নীচের সবকিছুই সাধারণ NumPy, এবং আমি ব্যাকওয়ার্ড পাসটি হাতে তৈরি করেছি। এটি সঠিক ধরণের বিরক্তিকর বলে প্রমাণিত হয়েছে। নিজে গ্রেডিয়েন্ট তৈরি করা আপনাকে সত্যিই বুঝতে বাধ্য করে যে মডেলটি ডেটার সাথে কী করছে, একটি .backward() কলের উপর বিশ্বাস করার পরিবর্তে যা আপনাকে কখনও ভাবতে হয়নি। আপনার যদি গণিতের পটভূমি থাকে এবং আপনি কখনও এমনকি একটি ছোট নেটওয়ার্কের মাধ্যমে ব্যাকপ্রপ হাতে তৈরি না করে থাকেন, আমি সত্যিই এটি একটি অনুশীলন হিসাবে সুপারিশ করি। এটি দশ মিনিটের চেইন রুল যা পরবর্তী সবকিছুকে ক্লিক করে তোলে। এই পোস্টের সমস্ত ডেটা সিন্থেটিক। আমি এটি কোডে নিজেই তৈরি করি, কোনো বাহ্যিক ডেটাসেট জড়িত নয়, যা মূল পেপারও করে। সমস্ত ছবি, অন্যথায় উল্লেখ না করা পর্যন্ত, লেখকের। এই সমস্যাটি যা ব্যাখ্যা করার চেষ্টা করছে: এখানে প্রেরণাদায়ী ধাঁধা, এবং এটি ব্যাখ্যাযোগ্যতা গবেষণায় একটি বাস্তব। আপনি যদি একটি প্রশিক্ষিত নিউরাল নেটওয়ার্কের ভিতরে তাকান, আশা করে যে পৃথক নিউরন পৃথক ধারণাগুলি পরিষ্কারভাবে উপস্থাপন করে, একটি নিউরন "এটি কি কুকুর?" এর জন্য, একটি "এটি কি লাল?" এর জন্য, আপনি বেশিরভাগই তা খুঁজে পান না। পরিবর্তে আপনি এমন নিউরন খুঁজে পান যা একসাথে বেশ কয়েকটি সম্পর্কহীন জিনিসের প্রতিক্রিয়া জানায়, একটি নিউরন যা বিড়ালের মুখ এবং গাড়ির সামনের অংশ উভয়ের জন্য সক্রিয় হয়, বলুন। এটিকে পলিসেম্যান্টিসিটি বলা হয়, এবং এটি ব্যাখ্যাযোগ্যতাকে অনেক কঠিন করে তোলে, কারণ আপনি পৃথক ইউনিট পরীক্ষা করে নেটওয়ার্ক "কী বিশ্বাস করে" তা পড়তে পারেন না। পেপারের প্রস্তাব হল পলিসেম্যান্টিসিটি শব্দ বা ব্যর্থতা নয়। এটি একটি বাস্তব কৌশল যা নেটওয়ার্ক উদ্দেশ্যমূলকভাবে ব্যবহার করে, কারণ এটির উপস্থাপন করার জন্য নিউরনের চেয়ে বেশি ধারণা রয়েছে, এবং সেই ধারণাগুলির বেশিরভাগই খুব কমই একই সময়ে সক্রিয় থাকে। যদি দুটি বৈশিষ্ট্য প্রায় কখনও একসাথে "চালু" না হয়, নেটওয়ার্ক তাদের সক্রিয়করণ স্থানে একটি দিক ভাগ করতে দিতে পারে, কারণ হস্তক্ষেপ কেবলমাত্র বিরল অনুষ্ঠানে খরচ করে যখন উভয়ই একসাথে সক্রিয় হয়। এই প্যাকিং কৌশলটিই পেপার সুপারপজিশন বলে, এবং এর টয় মডেলটি সবচেয়ে সহজ সম্ভাব্য সেটিং হওয়ার জন্য ডিজাইন করা হয়েছে যেখানে আপনি এটি ঘটতে দেখতে এবং প্রকৃতপক্ষে পরিমাপ করতে পারেন। মডেল, এবং গণিত যা আমাকে এটি প্রশিক্ষণের জন্য কাজ করতে হয়েছিল: সেটআপটি উদ্দেশ্যমূলকভাবে ছোট। আপনার কাছে n সিন্থেটিক বৈশিষ্ট্য রয়েছে, প্রতিটি 0 এবং 1 এর মধ্যে একটি সংখ্যা যা বেশিরভাগ সময় শূন্য (এটি স্পার্সিটি) এবং বাকি সময় অ-শূন্য। আপনি সেগুলিকে m লুকানো মাত্রার বাধার মাধ্যমে সংকুচিত করেন, যেখানে m, n এর চেয়ে ছোট, এবং তারপর ReLU এর মাধ্যমে বের হওয়ার সময় মূল বৈশিষ্ট্যগুলি পুনর্গঠন করার চেষ্টা করেন। কংক্রিটভাবে, একটি একক ওজন ম্যাট্রিক্স W আকারের (m, n) সংকোচন এবং পুনর্গঠন উভয়ের জন্য ব্যবহৃত হয়: h=W⋅x, x̂=ReLU(W⊤⋅h+b)। প্রশিক্ষণ x এবং x̂ এর মধ্যে একটি ওজনযুক্ত বর্গ ত্রুটি হ্রাস করে, যেখানে প্রতিটি বৈশিষ্ট্য i একটি গুরুত্ব ওজন Ii পায়, তাই নেটওয়ার্ককে বলা হয় যে কিছু বৈশিষ্ট্য অন্যদের চেয়ে সঠিক হওয়ার জন্য বেশি গুরুত্বপূর্ণ: L=∑i Ii⋅(xi−x̂i)²\m...