HeadlinesBriefing favicon HeadlinesBriefing.com

आउटलायर्स के विरुद्ध मजबूत रैखिक प्रतिगमन

Towards Data Science •
×

एक सरल मॉडल जिसमें एक गंभीर कमजोरी है: एक सीधी रेखा तब तक विश्वसनीय लग सकती है जब तक कि खराब माप इसे अपने मार्ग से दूर न खींच लें। भौतिक व्याख्या, संसाधन-प्रतिबंधित उपकरणों और कम्प्यूटेशनल विलंबता के लिए रैखिक प्रतिगमन अभी भी मूल्यवान है, लेकिन साधारण न्यूनतम वर्ग विधि प्रत्येक अवलोकन को विश्वसनीय मानती है। एक दोषपूर्ण सेंसर, संचार त्रुटि या पक्षपातपूर्ण माप एक अवलोकन उत्पन्न कर सकता है जो इच्छित संबंध से बहुत दूर है। क्योंकि OLS प्रत्येक अवशेष को वर्ग करता है, इसलिए कुछ ऐसे अवलोकन इसका अत्यधिक प्रभाव डाल सकते हैं। मजबूत अनुमानक उन अवलोकनों को फिट को हावी होने से रोकने का प्रयास करते हैं। चित्र 1 और 2 दिखाते हैं कि चित्र कितनी तेजी से बदल सकता है। स्वच्छ अवलोकनों के साथ, OLS नाममात्र संबंध का बारीकी से अनुसरण करता है। 30% प्रतिक्रियाओं को आउटलायर्स द्वारा प्रतिस्थापित करने के बाद, वही अनुमानक तीव्र रूप से दूर हो जाता है। हालांकि, एक प्रतिनिधि मजबूत फिट नाममात्र अवलोकनों द्वारा समर्थित संबंध के बहुत करीब रहता है। यह लेख OLS को गैर-मजबूत आधार रेखा के रूप में पांच मजबूत अनुमानकों: ह्यूबर प्रतिगमन, RANSAC, जेमन-मैकक्लुर हानि के साथ स्नातक गैर-संवहनीयता, ट्रंकेटेड न्यूनतम वर्ग हानि के साथ GNC और अनुकूली चयनात्मक आउटलायर अस्वीकृति के साथ तुलना करता है। अनुमानकों का मूल्यांकन भविष्यवाणी त्रुटि और रनटाइम का उपयोग करके किया जाता है ताकि सांख्यिकीय सटीकता और कम्प्यूटेशनल दक्षता दोनों को कैप्चर किया जा सके। लेखक ने मूल अध्ययन में ASOR विकसित किया था, जिससे मोंटे कार्लो वास्तविकताओं में प्रलेखित सेटिंग्स के साथ एक पारदर्शी तुलना सुनिश्चित हुई।

मुख्य संस्थाएं: कंपनियां: टुवार्ड्स डेटा साइंस | लोग: लेगेंड्रे, ह्यूबर, फिशलर और बोल्स, जेमन, मैकक्लुर, यांग, चुग्ताई

सामान्य प्रश्न: रैखिक प्रतिगमन में आउटलायर्स को मजबूत अनुमानक कैसे संभालते हैं?

मजबूत अनुमानक मॉडल से काफी भिन्न अवशेषों को कम वजन देने या अस्वीकार करने के द्वारा आउटलायिंग अवलोकनों को फिट को हावी होने से रोकते हैं, जिससे 30% संदूषण के साथ भी सटीकता बनी रहती है।

सामान्य प्रश्न: रैखिक प्रतिगमन में आउटलायर्स को मजबूत अनुमानक कैसे संभालते हैं?

सामान्य प्रश्न उत्तर: मजबूत अनुमानक मॉडल से काफी भिन्न अवशेषों को कम वजन देने या अस्वीकार करने के द्वारा आउटलायिंग अवलोकनों को फिट को हावी होने से रोकते हैं, जिससे 30% संदूषण के साथ भी सटीकता बनी रहती है।