HeadlinesBriefing favicon HeadlinesBriefing.com

Emparejamiento Fuzzy de Entity Key Drift en el Data Lake

Towards Data Science •
×

La mayoría de las personas que concilian identificadores desordenados recurren al mismo enfoque: tomar una métrica de distancia de edición, elegir un umbral y fusionar cualquier cosa suficientemente cercana. Damerau-Levenshtein es la mejora obvia sobre la distancia de edición simple. La lógica para elegirla es sólida. Trata una transposición (dos caracteres intercambiados) como un solo error en lugar de dos. En una extracción de 719 estaciones de sensores ambientales, se confirmó un error de escritura: sds1001 para sds011. Dos dígitos se intercambiaron, un error que cualquiera podría cometer en el teclado. La distancia de edición simple lo trata como dos ediciones, el mismo coste que cobraría por dos productos completamente diferentes. Damerau-Levenshtein, por el contrario, sabe que es un solo error y, desde el principio, le asigna una distancia de 1. Por lo tanto, es un mejor modelo de cómo suceden los errores tipográficos, y adoptarlo literalmente no tiene coste, convirtiéndolo en la opción más obvia.

Sin embargo, existe una consecuencia a menudo ignorada por la métrica. Aquí hay un ejemplo: hdc1008 y hdc1080 son dos sensores de humedad reales de Texas Instruments vendidos al mismo tiempo, documentados en diferentes hojas de datos. Mientras que la distancia de edición simple los coloca en 2, Damerau-Levenshtein los reduce a 1 al mismo rango que los errores de escritura mencionados anteriormente. Obsérvese cómo la misma propiedad que lo hace mejor para reconocer errores humanos también lo hace fusionar dos productos completamente diferentes que el fabricante numeró a propósito con un dígito de diferencia.

Este es el Parte 2 de mi serie de análisis profundo sobre el drift de entity key que comienza con la normalización. Si aún no has leído la Parte 1, vale la pena echarle un vistazo primero ya que cubre la limpieza determinista de la que este artículo da continuidad. El código y los datos de ambos están en Git Hub y Zenodo, por si quieres comprobar cualquier número por tu cuenta. En este artículo, describiré lo que sucedió cuando medí cinco métricas de similitud de cadenas contra el ground truth que verifiqué de las hojas de datos del fabricante, por qué ninguna de ellas pudo ajustarse para separar errores tipográficos de productos reales — y lo que significa ese fracaso para cómo debe construirse el sistema en su lugar. Esto es relevante para cualquier persona que concilie identificadores alfanuméricos cortos — números de parte, SKUs, códigos de modelo — de más de una fuente, y menos si provienen de una sola fuente.

Entidades clave: Empresas: Texas Instruments