HeadlinesBriefing favicon HeadlinesBriefing.com

Estágios determinísticos vs similaridade

Towards Data Science •
×

Desduplicar uma lista de 10.000 linhas de fornecedores em Python revela que a correspondência de strings é a parte fácil — decidir o que fazer com as pontuações de similaridade é o verdadeiro trabalho. A agência do autor compra posicionamentos editoriais de editores independentes, e registros duplicados de fornecedores custam dinheiro quando faturas são pagas duas vezes ou o histórico de preços se divide entre grafias que ninguém pesquisa.

O mesmo site aparece como solartravelmag.com, https://www.solartravelmag.com/, blog.solartravelmag.com e Solar Travel Mag. COM com parâmetros de rastreamento. Desde janeiro, um catálogo de marketplace externo foi sincronizado via sua API sobre uma década de entrada manual. Um marketplace admite que seus preços listados correspondem à realidade cerca de 90% do tempo, tornando a verificação cruzada obrigatória.

Uma reconstrução sintética da lista continha 11.531 linhas descrevendo 7.180 fornecedores reais, com 2.429 variantes de superfície, 888 linhas de subdomínio, 529 irmãos de domínio por país, 505 erros de digitação e 180 armadilhas de nomes próximos. Dois estágios determinísticos — normalização e colapso de subdomínio usando a Public Suffix List — removeram 76% das duplicatas gratuitamente. O fuzzy matcher pontuou 33,7 milhões de pares em dois segundos, mas nenhum limiar pôde mesclar com segurança o que restava. A saída real do matcher é uma fila de revisão ranqueada, não um conjunto de mesclagens.

Entidades-chave: Empresas: Towards Data Science | Pessoas: Fellegi, Sunter