HeadlinesBriefing favicon HeadlinesBriefing.com

Entity Key Drift Data Lake Fuzzy Matching

Towards Data Science •
×

Kebanyakan orang yang menyelaraskan pengidentifikasi yang kabur akan menggunakan pendekatan yang sama: ambil metrik jarak edit, pilih ambang batas, dan gabungkan segala sesuatu yang cukup dekat. Damerau-Levenshtein adalah upgrade yang jelas di atas jarak edit biasa. Alasan memilihnya adalah logis. Ia menganggap transposisi (dua karakter yang ditukar) sebagai satu kesalahan alih-alih dua. Dalam satu tarikan 719 stasiun sensor lingkungan, ada satu kesalahan pengetikan yang dikonfirmasi: sds1001 untuk sds011. Dua digit ditukar — kesalahan yang bisa saja dilakukan siapa saja di papan ketik. Jarak edit biasa menganggap ini sebagai dua editan, dengan harga yang sama untuk dua produk yang sama sekali berbeda. Damerau-Levenshtein, di sisi lain, tahu bahwa ini hanya satu kesalahan dan sejak awal menilainya sebagai jarak 1. Jadi ini adalah model yang lebih baik untuk menggambarkan cara kerja kesalahan pengetikan, dan adopsinya tidak menghabiskan apa-apa, membuatnya menjadi pilihan yang paling jelas.

Namun, ada satu kekurangan yang sering diabaikan dari metrik ini. Berikut adalah contoh: hdc1008 dan hdc1080 adalah dua sensor kelembapan asli dari Texas Instruments yang dijual pada waktu yang sama, terdokumentasikan dalam datasheet yang terpisah. Meskipun jarak edit biasa menempatkannya pada 2, Damerau-Levenshtein menurunkannya ke 1 dalam rentang yang sama seperti kesalahan pengetikan yang sebelumnya disebutkan. Perhatikan bagaimana sifat yang sama yang membuatnya lebih baik dalam mengenali kesalahan manusia juga menyebabkan padanya menggabungkan dua produk yang sama sekali berbeda yang produsen secara sengaja berlabel dengan satu digit perbedaan.

Ini adalah Bagian 2 dari rangkian eksplorasi mendalam tentang entity key drift yang dimulai dengan normalisasi. Jika Anda belum membaca Bagian 1, sebaiknya memeriksanya dulu karena mencakup pembersihan deterministik yang ditangani oleh bagian ini. Kode dan data kedua-belaknya tersedia di Git Hub dan Zenodo, jika Anda ingin memeriksa angka-angka mana pun sendiri. Dalam bagian ini, saya akan menjelaskan apa yang terjadi ketika saya mengukur lima metrik kemiripan string melawan ground truth yang saya verifikasi dari datasheet produsen, mengapa tidak satu pun dari mereka yang dapat disetel untuk memisahkan kesalahan pengetikan dari produk yang benar — dan apa arti kegagalan tersebut bagi cara sistem harus dibangun sebagai gantinya. Hal ini relevan bagi siapa pun yang menyelaraskan pengidentifikasi alfanumerik pendek — nomor part, SKU, kode model — dari lebih dari satu sumber, dan lebih sedikit jika sumbernya berasal dari satu sumber saja.

Entitas Kunci: Perusahaan: Texas Instruments