HeadlinesBriefing favicon HeadlinesBriefing.com

लॉग-सम-एक्सप विचरण विस्फोट: न्यूनतम वर्गों का समाधान

Hacker News •
×

मशीन लर्निंग में एक सामान्य कार्य है “लॉग-सम-एक्सप” फ़ंक्शनों का अनुमान लगाना या अनुकूलित करना, जिसमें (संभावित रूप से निरंतर रूप से) कई पद होते हैं जैसे $$ log Big( int_{\mathcal{X}} e^{v(x)} dq(x) Big),$$ जहाँ \(v: \mathcal{X} \to \mathbb{R}\) कोई स्थितिज्ञ फलन है, और \(q\) सेट \(\mathcal{X}\) पर एक संभाव्यता वितरण है। इसका डेटा विज्ञान में व्यापक अनुप्रयोग है, अक्सर संभाव्यता मॉडलों के मानकीकरण के माध्यम से, लेकिन अधिकतम के एक चिकना अनुमान के रूप में भी, ट्रांसफ़ॉर्मर में इसके अवकलजों के माध्यम से, या एंट्रॉपी नियमन के उपयोग के साथ पुनर्बलन सीखने में [19]। कभी-कभी सेट \(\mathcal{X}\) सीमित होता है (संभावित रूप से बड़ा) और積分 को स्पष्ट जोड़ द्वारा किया जा सकता है, लेकिन अक्सर सटीक गणना असंभव होती है, और इसके बजाय संभाव्यता वितरण \(q\) से नमूना लिया जाता है। ऐसी अनुमानों के विचरण से मुख्य कठिनाई उत्पन्न होती है, विशेष रूप से जब \(v\) बड़े मान लेता है। सबसे सरल उदाहरण में, \(z_1,\dots,z_n \in \mathbb{R}\) स्वतंत्र और सामान्य रूप से वितरित होते हैं, जिनका माध्य \(\mu\) और विचरण \(\sigma^2\) होता है, तो \(\mathbb{E}[e^z]\) का अनुमान लगाने के लिए सापेक्ष वर्ग त्रुटि $$\frac{ {\rm var}\big( \frac{1}{n} \sum_{i=1}^n e^{z_i} \big) }{( \mathbb{E}[ e^{z} ])^2} = \frac{1}{n} \frac{ {\rm var}(e^z) }{( \mathbb{E}[ e^{z} ])^2} = \frac{ e^{\sigma^2}-1}{n}.$$ जब \(n\) बढ़ता है तो यह शून्य की ओर अभिसरित होता है (जैसा कि बड़ी संख्या के नियम से अपेक्षित होता है), लेकिन जब \(\sigma\) बढ़ता है तो यह घातीय रूप से विस्फोटित हो जाता है। incluso लघुगणक लेना भी विचरण के विस्फोट को नहीं बदलता है, अर्थात् ${\rm var}\big( \log \big( \frac{1}{n} \sum_{i=1}^n e^{z_i} \big)\big)$ भी दिखाया जा सकता है कि जब \(n\) बड़ा होता है (जैसा कि डेल्टा विधि से प्राप्त किया जा सकता है), तो यह \frac{ e^{\sigma^2}-1}{n} के समान तरीके से asymptotic रूप से बढ़ता है।हालांकि अनुमान लगाना कठिन है, लॉग-सम-एक्सप फ़ंक्शन में कई अच्छे गुण होते हैं (और यही कारण है कि लोग इसे पसंद करते हैं); मैं विशेष रूप से यह पसंद करता हूं कि (1) यह अधिकतम का एक चिकना अनुमान है (देखें, उदाहरण के लिए, इस पिछले पोस्ट), और (2) यह संभाव्यता मॉडलों को मानकीकृत करने का एक तरीका है जो अधिकतम संभाव्यता अनुमान के लिए अनुकूल है, विशेष रूप से स्तरित संभाव्यता मॉडलों में, जहाँ (शर्ती) स्वतंत्रता धारणाएँ संबंधित हानि कार्यों के पृथक्करण को जन्म देती हैं (जैसा कि संभाव्यता ग्राफ़िकल मॉडल में व्यापक रूप से उपयोग किया जाता है)।इस पोस्ट में मैं जिस मुख्य प्रश्न का उत्तर देने की कोशिश कर रहा हूँ वह है: क्या हम लॉग-सम-एक्सप फ़ंक्शनों के अनुकूलन के लाभों को बनाए रखते हुए उनके गणनात्मक/सांख्यिकीय नुकसानों के प्रति कम संवेदनशील हो सकते हैं? स्पेक्ट्रम के दूसरे छोर पर न्यूनतम वर्गों का विघटन होता है, जिसकी विशेषताएँ मूल रूप से विपरीत होती हैं: सकारात्मक पक्ष पर, हम विभिन्न रूपों में गणनात्मक और सांख्यिकीय सरलता प्राप्त करते हैं, उदाहरण के लिए, यह रैखिक मॉडलों के लिए रैखिक बीजगणित के माध्यम से बंद-फ़ॉर्म अनुमान देता है, यह निश्चित नियंत्रित विचरण के साथ मोमेंट्स की गणना पर आधारित है, और यह विभिन्न सेटअप्स (त्वरण, स्टोकेस्टिक ग्रेडिएंट डिसेंट, आदि) में तीखे विश्लेषण देता है। देखें, उदाहरण के लिए, इस पोस्ट पर त्वरण, और इस एक पर औसत। नकारात्मक पक्ष पर, सभी भविष्यवाणी समस्याओं के लिए न्यूनतम वर्गों के विघटन का उपयोग करना, विशेष रूप से अलग-अलग आउटपुट के साथ, कुछ कलाकृतियाँ पैदा करता है। पारंपरिक उदाहरण गॉसियन वर्ग-शर्ती डेटा (समान सहसंबंध मैट्रिक्स के साथ) के वर्गीकरण है, जहाँ एक-हॉट एन्कोडेड आउटपुट पर न्यूनतम वर्गों के विघटन से समस्याएँ होती हैं, जैसे “मास्किंग” (देखें [13, अनुभाग 2.4] और नीचे दिया गया उदाहरण), या बहुपदीय लॉजिस्टिक रिग्रेशन (जिसे सॉफ्टमैक्स रिग्रेशन भी कहा जाता है) की तुलना में उच्च अनुमान त्रुटि, क्योंकि तब लॉग शर्ती संभाव्यताएँaffine होती हैं। क्या हम उन्हें सुलझा सकते हैं? अन्य शब्दों में, क्या न्यूनतम वर्गों का विघटन वास्तव में सब कुछ है जो मुझे चाहिए? (मेरे सहकर्मी कभी-कभी मेरे न्यूनतम वर्गों के विघटन के प्रति प्रेम का मज़ाक उड़ाते हैं)।ध्यान दें कि दुनिया को न्यूनतम वर्गों के विघटन के माध्यम से देखने का एक और (क्लासिक) प्रयास है: न्यूटन की विधि के माध्यम से श्रृंखला में करना, जिससे इस संदर्भ में iteratively reweighted least-squares होता है, लेकिन यह केवल गणना के लिए है, सांख्यिकीय सुधार के बिना। हम जो लक्ष्य रख रहे हैं वह अधिक मज़बूत......