HeadlinesBriefing favicon HeadlinesBriefing.com

Deterministische Phasen vs Ähnlichkeitswerte

Towards Data Science •
×

Das Deduplizieren einer 10.000-Zeilen-Lieferantenliste in Python zeigt, dass String-Matching der einfache Teil ist — zu entscheiden, was mit Ähnlichkeitswerten zu tun ist, ist die eigentliche Arbeit. Die Agentur des Autors kauft redaktionelle Platzierungen von unabhängigen Verlegern, und doppelte Lieferantendatensätze kosten Geld, wenn Rechnungen doppelt bezahlt werden oder der Preisverlauf über Schreibweisen aufgeteilt wird, die niemand sucht.

Derselbe Ort erscheint als solartravelmag.com, https://www.solartravelmag.com/, blog.solartravelmag.com und Solar Travel Mag. COM mit Tracking-Parametern. Seit Januar wurde ein externer Marktplatz-Katalog über seine API über einem Jahrzehnt manueller Eingabe synchronisiert. Ein Marktplatz gibt zu, dass seine gelisteten Preise zu etwa 90% der Zeit der Realität entsprechen, was Kreuzprüfungen obligatorisch macht.

Ein synthetischer Neuaufbau der Liste enthielt 11.531 Zeilen, die 7.180 tatsächliche Anbieter beschrieben, mit 2.429 Oberflächenvarianten, 888 Subdomain-Zeilen, 529 Länder-Domain-Geschwistern, 505 Tippfehlern und 180 Near-Namen-Fallen. Zwei deterministische Phasen — Normalisierung und Subdomain-Kollaps mit der Public Suffix List — entfernten 76% der Duplikate kostenlos. Der Fuzzy-Matcher bewertete 33,7 Millionen Paare in zwei Sekunden, aber kein Schwellenwert konnte das Verbleibende sicher zusammenführen. Die eigentliche Ausgabe des Matchers ist eine priorisierte Prüfwarteschlange, keine Menge von Zusammenführungen.

Schlüsselentitäten: Unternehmen: Towards Data Science | Personen: Fellegi, Sunter