HeadlinesBriefing favicon HeadlinesBriefing.com

Correspondência Fuzzy Entity Key Drift no Data Lake

Towards Data Science •
×

A maioria das pessoas que conciliam identificadores bagunçados recorre ao mesmo enfoque: pegar uma métrica de distância de edição, escolher um limiar e mesclar qualquer coisa o suficiente próxima. Damerau-Levenshtein é a evolução óbvia sobre a distância de edição simples. O raciocínio para escolhê-la é sólido. Ele trata uma transposição (dois caracteres trocados) como um único erro em vez de dois. Em uma pega de 719 estações de sensores ambientais, uma correção de digitação confirmada foi sds1001 para sds011. Dois dígitos foram trocados, um erro que qualquer um poderia cometer no teclado. A distância de edição simples a trata como duas edições, o mesmo preço que cobraria por dois produtos completamente diferentes. Damerau-Levenshtein, por outro lado, sabe que é um único erro e, desde o início, a avalia como distância 1. Então é um melhor modelo de como os erros de digitação acontecem, e adotá-lo literalmente não custa nada, tornando-o a escolha mais óbvia.

No entanto, há uma desvantagem muitas vezes negligenciada da métrica. Aqui está um exemplo: hdc1008 e hdc1080 são dois sensores de umidade reais da Texas Instruments vendidos ao mesmo tempo, documentados em folhas de dados separadas. Embora a distância de edição simples os coloque em 2, Damerau-Levenshtein os puxa para 1 no mesmo intervalo que as digitações mencionadas anteriormente. Note como a mesma propriedade que o torna melhor em reconhecer erros humanos também o faz mesclar dois produtos completamente diferentes que o fabricante numerou deliberadamente com um dígito de diferença.

Esta é a Parte 2 da minha série de mergulho profundo sobre entity key drift que começa com normalização. Se você ainda não leu a Parte 1, vale a pena dar uma olhada primeiro, já que ela cobre a limpeza determinística que este artigo continua. O código e os dados de ambos estão no Git Hub e Zenodo, caso você queira verificar qualquer número por sua conta. Neste artigo, vou caminhar através do que aconteceu quando medi cinco métricas de similaridade de string contra a ground truth que verifiquei dos datasheets do fabricante, por que nenhuma delas pôde ser ajustada para separar digitações de produtos reais — e o que esse fracasso significa para como o sistema precisa ser construído ao invés disso. Isso é relevante para qualquer pessoa conciliando identificadores alfanuméricos curtos — números de peça, SKUs, códigos de modelo — de mais de uma fonte, e menos se vierem de uma única fonte.

Entidades-chave: Empresas: Texas Instruments