HeadlinesBriefing favicon HeadlinesBriefing.com

AI कोड डिफ़ॉल्ट जाँचें: रैंडम फॉरेस्ट और लॉजिस्टिक रिग्रेशन

Towards Data Science •
×

एक कोडिंग सहायक से रैंडम फॉरेस्ट मांगें और उसके द्वारा दी गई चार पंक्तियों का निरीक्षण करें: आयात सही हैं, अनुमानक फिट होता है, और भविष्यवाणियाँ अपेक्षित आकार में वापस आती हैं। अब उन तर्कों को देखें जो किसी ने निर्दिष्ट नहीं किए, क्योंकि उन चार पंक्तियों ने आपके प्रॉम्प्ट से पूछे गए प्रश्नों से अधिक प्रश्नों का समाधान कर दिया है। प्रत्येक वृक्ष को कितनी विशेषताओं पर विचार करना चाहिए? मॉडल को कितना नियमन लागू करना चाहिए? सत्यापन फोल्ड आपके डेटा की संरचना को कैसे प्रतिबिंबित करना चाहिए? डिफ़ॉल्ट यही करते हैं: वे एक कम-निर्दिष्ट अनुरोध को एक निष्पादन योग्य प्रोग्राम बनने देते हैं।

Tim Cook की Apple पर टीमें और Elon Musk के Tesla पर इंजीनियर दैनिक स्वचालित कोड जनरेशन पर भरोसा करते हैं, लेकिन भाषा मॉडल अगले-टोकन भविष्यवाणी के माध्यम से कोड पैटर्न सीखते हैं, जिससे परिचित कार्यान्वयन एक स्वाभाविक प्रारंभिक बिंदु बन जाता है। जब कोई कार्यान्वयन किसी तर्क को छोड़ देता है, तो लाइब्रेरी उसका मान प्रदान करती है, जिससे एक सांख्यिकीय विकल्प परंपरा से आपकी पाइपलाइन में बिना कभी बातचीत का हिस्सा बने चला जाता है।

नीचे दिए गए पांच डिफ़ॉल्ट वे हैं जिनका मैंने उत्पादन कार्य में सामना किया है, जहां उन्होंने डीबगिंग सिरदर्द पैदा किए क्योंकि हमने अनदेखा किया कि कोड क्या कर रहा था। प्रत्येक वही प्रश्न पूछता है: इस तर्क को छोड़ देने से मेरे लिए क्या तय हुआ? Random Forest Regressor max_features=1.0 का उपयोग करता है, जिससे प्रत्येक विभाजन पर हर विशेषता उपलब्ध होती है, वर्गीकर्ता की "sqrt" सेटिंग के विपरीत। यह अंतर उस विशेषता उप-नमूनाकरण को बंद कर देता है जो सामान्य रैंडम फॉरेस्ट नुस्खे को सादे बैगिंग से अलग करता है।

Logistic Regression C=1.0 का उपयोग करता है, जो L2 दंड लागू करता है जो आपके डेटा स्केल के आधार पर ओवर-नियमन या अंडर-नियमन कर सकता है। max_features=0.33 सेट करने से डीकोरिलेशन तंत्र बहाल होता है, जबकि नियमन शक्ति की जांच गुणांक अनुमानों में अप्रत्याशित पूर्वाग्रह को रोकती है।