HeadlinesBriefing favicon HeadlinesBriefing.com

धोखाधड़ी पहचान मॉडल प्रशिक्षण: सर्वश्रेष्ठ मॉडल तैनात नहीं

Towards Data Science •
×

अंतिम वर्ष की परियोजना में, मैंने दो सार्वजनिक डेटासेट का उपयोग करके धोखाधड़ी पहचान के लिए छह मॉडल प्रशिक्षित किए: PaySim (मोबाइल मनी) और IEEE-CIS (कार्ड लेनदेन)। उच्च सटीकता प्राप्त करने के बावजूद, सर्वश्रेष्ठ प्रदर्शन करने वाला मॉडल उत्पादन बाधाओं के कारण तैनात नहीं किया गया। तैनात मॉडल केवल तीन विशेषताओं का उपयोग करता है—लेनदेन राशि, वन-हॉट एन्कोडेड चैनल, और स्रोत डेटासेट—क्योंकि डेटासेट में सामान्य फ़ील्ड नहीं थे। वर्ग असंतुलन को संभालने के लिए SMOTE की आवश्यकता थी, लेकिन तैनाती के लिए एक फ़ॉलबैक इंटरपोलेशन विधि का उपयोग किया गया। परियोजना ने ऑफ़लाइन मेट्रिक्स और वास्तविक दुनिया के उत्पादन निर्णयों के बीच अंतर को उजागर किया। सर्वश्रेष्ठ मॉडल, संभवतः XGBoost, व्यवहार में एक सरल मॉडल से बेहतर प्रदर्शन किया गया जो बेहतर सामान्यीकरण करता था। इस अनुभव ने मुझे सिखाया कि मॉडल चयन में तैनाती की व्यवहार्यता पर विचार करना चाहिए, न कि केवल प्रदर्शन मेट्रिक्स।