HeadlinesBriefing favicon HeadlinesBriefing.com

Entity Key Drift Data Lake Fuzzy Matching

Towards Data Science •
×

Die meisten Menschen, die Chaos-Identifikatoren vereinheitlichen, greifen zum gleichen Ansatz: Nehmen Sie eine Abstandsmessung, wählen Sie eine Schwelle und führen Sie alles Zusammengehörige zusammen. Damerau-Levenshtein ist die offensichtliche Upgrade-Option gegenüber der einfachen Bearbeitungsdistanz. Die Überlegung, sie zu wählen, ist fundiert. Sie behandelt eine Transposition (zwei vertauschte Zeichen) als einen Fehler anstatt zwei. Bei einem Pull von 719 Umweltsensor-Stationen wurde eine bestätigte Tippfehler gefunden: sds1001 für sds011. Zwei Ziffern wurden vertauscht – ein Fehler, den jemand auf einer Tastatur leicht machen kann. Die einfache Bearbeitungsdistanz behandelt dies als zwei Bearbeitungen, den gleichen Preis, den sie für zwei völlig unterschiedliche Produkte verlangen würde. Damerau-Levenshtein dagegen weiß, dass es sich um einen einzelnen Fehler handelt und bewertet ihn von Anfang an als Distanz 1. Also ist es ein besseres Modell dafür, wie Tippfehler entstehen, und es kostet nichts, sie zu adoptions, wodurch es die offensichtlichste Wahl ist.

Es gibt jedoch eine oft übersehene Nachteile dieser Metrik. Hier ist ein Beispiel: hdc1008 und hdc1080 sind zwei echte Texas Instruments-Luftfeuchtionssensoren, die gleichzeitig verkauft wurden und in separaten Datenblättern dokumentiert sind. Während die einfache Bearbeitungsdistanz sie auf 2 legt, zieht Damerau-Levenshtein sie auf 1 in den gleichen Bereich wie die oben erwähnten Tippfehler. Beachten Sie, wie dieselbe Eigenschaft, die sie besser macht, menschliche Fehler zu erkennen, auch dazu führt, dass sie zwei völlig unterschiedliche Produkte zusammenführt, die der Hersteller bewusst mit einem Ziffernunterschied nummeriert hat.

Dies ist Teil 2 meiner tiefen Series zum Entity Key Drift, die mit Normalisierung beginnt. Wenn Sie noch nicht zu Teil 1 gelesen haben, lohnt es sich, darüber nachzudenken, da es die deterministische Bereinigung abdeckt, die dieser Beitrag aufgreift. Der Code und die Daten für beide sind auf Git Hub und Zenodo verfügbar, falls Sie jede Zahl selbst überprüfen möchten. In diesem Beitrag werde ich erklären, was passiert ist, als ich fünf Zeichenvergleichsmetriken gegen die Ground Truth misste, die ich vom Hersteller-Datenblatt verifiziert habe, warum keine davon verfeinert werden konnte, um Tippfehler von echten Produkten zu trennen – und was diese Fehlschlag für die Bauweise des Systems bedeutet. Dies ist relevant für jeden, der kurze alphanumerische Identifikatoren – Bauteilnummern, SKUs, Modellcodes — aus mehr als einer Quelle vereinheitlicht, und weniger, wenn sie aus einer einzigen Quelle stammen.

Schlüssel-Entitäten: Unternehmen: Texas Instruments