HeadlinesBriefing favicon HeadlinesBriefing.com

Correspondance floue Entity Key Drift dans le Data Lake

Towards Data Science •
×

La plupart des personnes qui concilient des identifiants désordonnés se tournent vers la même approche: prendre un indicateur de distance d'édition, choisir un seuil, et fusionner n'importe quoi assez proche. Damerau-Levenshtein est le remplacement évident de la distance d'édition simple. Le raisonnement pour le choisir est solide. Il considère une transposition (deux caractères échangés) comme une seule erreur au lieu de deux. Dans une extraction de 719 stations de capteurs environnementaux, une erreur d'orthographe confirmée était sds1001 pour sds011. Deux chiffres ont été échangés, une erreur que n'importe qui pourrait commettre au clavier. La distance d'édition simple la traite comme deux éditions, le même prix pour deux produits totalement différents. Damerau-Levenshtein, quant à elle, sait que c'est une seule erreur et, dès le départ, l'évalue à une distance de 1. Donc c'est un meilleur modèle de la manière dont les fautes de frappe se produisent, et l'adopter ne coûte rien, ce qui en fait le choix le plus évident.

Cependant, il existe un inconvénient souvent négligé de cette métrique. Voici un exemple: hdc1008 et hdc1080 sont deux capteurs d'humidité réels de Texas Instruments vendus en même temps, documentés sur des fiches techniques séparées. Bien que la distance d'édition simple les place à 2, Damerau-Levenshtein les ramène à 1 dans la même gamme que les fautes d'orthographe mentionnées plus tôt. Notez comment la même propriété qui le rend meilleur pour reconnaître les erreurs humaines le fait également fusionner deux produits entièrement différents que le fabricant a numérotés à des chiffres près.

Il s'agit de la Partie 2 de ma série d'exploration approfondie sur le entity key drift qui commence par la normalisation. Si vous n'avez pas encore lu la Partie 1, il vaut la peine d'y jeter un œil, car elle couvre le nettoyage déterministe dont cette pièce reprend le flot. Le code et les données des deux sont disponibles sur Git Hub et Zenodo, au cas où vous voudriez vérifier n'importe quel chiffre par vous-même. Dans cette pièce, je vais expliquer ce qui s'est passé lorsque j'ai mesuré cinq métriques de similarité de chaînes contre le ground truth que j'ai vérifié à partir des fiches techniques du fabricant, pourquoi aucune d'elles ne pouvait être ajustée pour séparer les fautes d'orthographe des produits réels — et ce que cette échec signifie pour la manière dont le système doit être construit à la place. Cela est pertinent pour n'importe qui conciliant des identifiants alphanumériques courts — numéros de pièce, SKUs, codes modèle — provenant de plusieurs sources, et moins si proviennent d'une seule source.

Entités clés: Entreprises: Texas Instruments