HeadlinesBriefing favicon HeadlinesBriefing.com

Etapas deterministas vs similitud en deduplicación

Towards Data Science •
×

Deduplicar una lista de proveedores de 10,000 filas en Python revela que la coincidencia de cadenas es la parte fácil — decidir qué hacer con las puntuaciones de similitud es el verdadero trabajo. La agencia del autor compra ubicaciones editoriales de editores independientes, y los registros duplicados de proveedores cuestan dinero cuando las facturas se pagan dos veces o el historial de precios se divide entre ortografías que nadie busca.

El mismo sitio aparece como solartravelmag.com, https://www.solartravelmag.com/, blog.solartravelmag.com y Solar Travel Mag. COM con parámetros de seguimiento. Desde enero, un catálogo de mercado externo se ha sincronizado a través de su API sobre una década de entrada manual. Un mercado admite que sus precios listados coinciden con la realidad aproximadamente el 90% del tiempo, lo que hace obligatoria la verificación cruzada.

Una reconstrucción sintética de la lista contenía 11,531 filas que describían 7,180 proveedores reales, con 2,429 variantes superficiales, 888 filas de subdominio, 529 hermanos de dominio por país, 505 errores tipográficos y 180 trampas de nombres cercanos. Dos etapas deterministas — normalización y colapso de subdominio usando la Lista de Sufijos Públicos — eliminaron 76% de duplicados gratis. El emparejador difuso puntuó 33,7 millones de pares en dos segundos, pero ningún umbral pudo fusionar de forma segura lo que quedaba. La salida real del emparejador es una cola de revisión ordenada, no un conjunto de fusiones.

Entidades clave: Empresas: Towards Data Science | Personas: Fellegi, Sunter