HeadlinesBriefing favicon HeadlinesBriefing.com

एंटिटी की ड्रिफ्ट डेटा लेक फज़ी मैचिंग

Towards Data Science •
×

अधिकांश लोग जो गुम्बुर्ज़ आईडेंटिफ़ायरर्स को एक साझेदारी करते हैं, वे समान तरीके से पहुँचते हैं: एक संपादन दूरी माप लें, एक सीमा चुनें, और कुछ भी पर्याप्त रूप से नजदीक कुछ को मिलाएं। Damerau-Levenshtein, सामान्य संपादन दूरी के ऊपर एक स्पष्ट उपयोगी है। इसे चुनने की तर्कसंगतता ठोस है। यह एक ट्रांसपोज़िशन (दो बदल लिए गए अक्षर) को दो में नहीं, बल्कि एक त्रुटि के रूप में मानता है। 719 पर्यावरण सेंसर स्टेशनों के एक पुल में, एक पुष्टि की गई गलत लिखावट थी sds1001 के लिए sds011। दो आंकड़े बदल गए थे — कोई भी कीबोर्ड पर एक सरल त्रुटि कर सकता है। सामान्य संपादन दूरी इसे दो संपादन के रूप में देखती है, जो दो पूरी तरह से अलग उत्पादों के लिए समान लागत होती है। Damerau-Levenshtein दूरहाँ भी पता चलता है कि यह एक ही त्रुटि है और इसे शुरू से ही दूरी 1 के रूप में दर्शाता है। इसलिए यह एक बेहतर मॉडल है कैसे त्रुटियाँ होती हैं, और इसे अपनाना वास्तव में कोई लागत नहीं है, जिससे यह सबसे स्पष्ट चुनाव बन जाता है।

हालांकि, इस मापदंड में अक्सर नजरअंदाज किया जाने वाला एक नुकसान है। यहाएँ एक उदाहरण है: hdc1008 और hdc1080 दो वास्तविक Texas Instruments नमी सेंसर हैं जो समय पर बेचे गए हैं, जो अलग-अलग datasheet में दस्तावेज़ीकृत हैं।हालांकि सामान्य संपादन दूरी उन्हें 2 पर रखती है, Damerau-Levenshtein उन्हें 1 के एक ही दायरे में ले जाता है जैसे पहिले उल्लेखित त्रुटियाँ। ध्यान दें कि इसकी वही गुणधर्म जो इसे मानव त्रुटियों को पहचानने में बेहतर बनाती है, उसे दो पूरी तरह से अलग उत्पादों को मिलाती है जो निर्माता सच में एक अंक क अलग संख्या में संख्या देता है।

यह मेरे entity key drift पर एक गहन डाइव सीरीज़ का भाग 2 है जो normalization से शुरू होता है। यदि आपने अभी तक Part 1 को पढ़ा नहीं है, तो उसे पहले देखना वालिम है क्योंकि यह उसे इस खंड के साथ जोड़ता है। दोनों का कोड और डेटा Git Hub और Zenodo पर उपलब्ध है, ताकि आप अपनी स्वयं किसी भी संख्या की जाँच कर सकें। इस लेख में, मैं आपको बताऊंगा जब मैंने पांच स्ट्रिंग-समानता मापदंडों को उन manufacturer datasheet से जो मैंने पुष्टि किए हैं उस ground truth के खिलाफ मापा, क्योंकि कोई भी उन्हें त्रुटियों को वास्तविक उत्पादों से अलग करने के लिए समायोजित नहीं हो सका — और उस असफलता का अर्थ कैसे data lake में एंटिटी मैचिंग को बनाना चाहिए। यह किसी के लिए प्रासंगिक है जो एक से अधिक स्रोतों से छोटे अल्फ़ा-न्यूमेरिक आईडेंटिफ़ायरर्स — पार्ट नंबर, SKUs, मॉडल कोड — को एक साझेदारी करते हैं, और कम उसे सिंगल स्रोत से आने वाले के लिए।

की एंटिटीज़: कंपनियाँ: Texas Instruments