HeadlinesBriefing favicon HeadlinesBriefing.com

छोटा नेटवर्क डेटा संपीड़ित करता है, पेंटागन को आकर्षित करता है

Towards Data Science •
×

मुझे उम्मीद नहीं थी कि ज्यामिति दिखाई देगी। मैं Anthropic के 2022 के व्याख्यात्मकता पेपर, "टॉय मॉडल्स ऑफ सुपरपोज़िशन" [1] का एक छोटा सा हिस्सा पुन: प्रस्तुत कर रहा था, मुख्य रूप से क्योंकि केंद्रीय दावा इतना असंभव लग रहा था कि मैं इसे विश्वास पर लेने के बजाय स्वयं जांचना चाहता था। दावा: एक तंत्रिका नेटवर्क अपने पास मौजूद आयामों से अधिक सुविधाओं का प्रतिनिधित्व कर सकता है, उन्हें एक दूसरे के कोणों पर पैक करके और थोड़ा हस्तक्षेप सहन करके। इसे सही परिस्थितियों में पांच चीजों को दो आयामों में संपीड़ित करने के लिए कहें, और यह दो विजेताओं को नहीं चुनता और बाकी को छोड़ देता है। यह सभी पांच को एक पूर्ण पंचभुज में व्यवस्थित करता है। मेरे पास PyTorch या कोई ऑटोग्रेड लाइब्रेरी उपलब्ध नहीं थी, और इसे स्थापित करने के लिए इंटरनेट एक्सेस भी नहीं था, इसलिए नीचे सब कुछ सादा NumPy है, और मैंने बैकवर्ड पास हाथ से निकाला। यह सही प्रकार का कष्टप्रद निकला। स्वयं ग्रेडिएंट्स प्राप्त करना आपको वास्तव में समझने के लिए मजबूर करता है कि मॉडल डेटा के साथ क्या कर रहा है, न कि .backward() कॉल पर भरोसा करना जिसके बारे में आपको कभी सोचना नहीं पड़ा। यदि आपके पास गणित की पृष्ठभूमि है और आपने कभी छोटे नेटवर्क के माध्यम से भी बैकप्रॉप हाथ से नहीं निकाला है, तो मैं वास्तव में इसे एक अभ्यास के रूप में सुझाता हूं। यह दस मिनट की श्रृंखला नियम है जो बाद की सभी चीजों को क्लिक कराता है। इस पोस्ट में सभी डेटा सिंथेटिक है। मैं इसे कोड में स्वयं उत्पन्न करता हूं, कोई बाहरी डेटासेट शामिल नहीं है, जो मूल पेपर भी करता है। सभी छवियां, जब तक अन्यथा नोट न किया गया हो, लेखक द्वारा हैं। यह समस्या जिसे समझाने की कोशिश कर रही है: यहाँ प्रेरक पहेली है, और यह व्याख्यात्मकता अनुसंधान में एक वास्तविक है। यदि आप एक प्रशिक्षित तंत्रिका नेटवर्क के अंदर देखते हैं, उम्मीद करते हुए कि व्यक्तिगत न्यूरॉन्स व्यक्तिगत अवधारणाओं को स्पष्ट रूप से प्रस्तुत करते हैं, एक न्यूरॉन "क्या यह कुत्ता है" के लिए, एक "क्या यह लाल है" के लिए, आपको ज्यादातर वह नहीं मिलता। इसके बजाय आपको ऐसे न्यूरॉन्स मिलते हैं जो एक साथ कई असंबंधित चीजों का जवाब देते हैं, एक न्यूरॉन जो बिल्ली के चेहरे और कारों के सामने के हिस्से दोनों के लिए सक्रिय होता है, कहें। इसे पॉलीसेमैंटिसिटी कहा जाता है, और यह व्याख्यात्मकता को बहुत कठिन बना देता है, क्योंकि आप व्यक्तिगत इकाइयों का निरीक्षण करके यह नहीं पढ़ सकते कि नेटवर्क "क्या मानता है"। पेपर का प्रस्ताव है कि पॉलीसेमैंटिसिटी शोर या विफलता नहीं है। यह एक वास्तविक रणनीति है जो नेटवर्क जानबूझकर उपयोग करता है, क्योंकि उसके पास प्रतिनिधित्व करने के लिए अधिक अवधारणाएं हैं, और उनमें से अधिकांश शायद ही कभी एक ही समय में सक्रिय होती हैं। यदि दो विशेषताएं लगभग कभी एक साथ "चालू" नहीं होती हैं, तो नेटवर्क उन्हें सक्रियण स्थान में एक दिशा साझा करने की अनुमति दे सकता है, क्योंकि हस्तक्षेप केवल दुर्लभ अवसरों पर लागत देता है जब दोनों एक साथ सक्रिय होते हैं। यह पैकिंग रणनीति वह है जिसे पेपर सुपरपोज़िशन कहता है, और इसका टॉय मॉडल सबसे सरल संभव सेटिंग होने के लिए डिज़ाइन किया गया है जहां आप इसे होते देख सकते हैं और वास्तव में माप सकते हैं। मॉडल, और गणित जो मुझे इसे प्रशिक्षित करने के लिए काम करना पड़ा: सेटअप जानबूझकर छोटा है। आपके पास n सिंथेटिक विशेषताएं हैं, प्रत्येक 0 और 1 के बीच एक संख्या है जो अधिकांश समय शून्य होती है (वह स्पार्सिटी है) और बाकी समय गैर-शून्य होती है। आप उन्हें m छिपे हुए आयामों के अड़चन के माध्यम से संपीड़ित करते हैं, जहां m, n से छोटा है, और फिर ReLU के माध्यम से बाहर निकलते समय मूल विशेषताओं का पुनर्निर्माण करने का प्रयास करते हैं। ठोस रूप से, एक आकार (m, n) के एकल वजन मैट्रिक्स W के साथ संपीड़न और पुनर्निर्माण दोनों के लिए उपयोग किया जाता है: h=W⋅x, x̂=ReLU(W⊤⋅h+b)। प्रशिक्षण x और x̂ के बीच एक भारित वर्ग त्रुटि को कम करता है, जहां प्रत्येक विशेषता i को महत्व भार Ii मिलता है, इसलिए नेटवर्क को बताया जाता है कि कुछ विशेषताएं दूसरों की तुलना में सही होने के लिए अधिक महत्वपूर्ण हैं: L=∑i Ii⋅(xi−x̂i)²\m...