HeadlinesBriefing favicon HeadlinesBriefing.com

Tahap Deterministik vs Skor Kemiripan

Towards Data Science •
×

Deduplikasi daftar supplier 10.000-baris di Python mengungkapkan bahwa pencocokan string adalah bagian mudah — memutuskan apa yang harus dilakukan dengan skor kemiripan adalah pekerjaan sebenarnya. Agensi penulis membeli penempatan editorial dari penerbit independen, dan catatan supplier duplikat menghabiskan uang saat faktur dibayar dua kali atau riwayat harga terpecah di seluruh ejaan yang tidak dicari siapa pun.

Situs yang sama muncul sebagai solartravelmag.com, https://www.solartravelmag.com/, blog.solartravelmag.com, dan Solar Travel Mag. COM dengan parameter pelacakan. Sejak Januari, katalog marketplace eksternal telah disinkronkan melalui API-nya di atas satu dekade entri manual. Satu marketplace mengakui harga yang terdaftarnya cocok dengan realitas sekitar 90% waktu, membuat pemeriksaan silang menjadi wajib.

Pembangunan sintetis ulang daftar berisi 11.531 baris yang mendeskripsikan 7.180 vendor aktual, dengan 2.429 varian permukaan, 888 baris subdomain, 529 saudara domain-negara, 505 kesalahan ketik, dan 180 jebakan nama-dekat. Dua tahap deterministik — normalisasi dan kolaps subdomain menggunakan Public Suffix List — menghapus 76% duplikat secara gratis. Pencocok fuzzy menilai 33,7 juta pasangan dalam dua detik, tetapi tidak ada ambang yang dapat dengan aman menggabungkan yang tersisa. Keluaran sebenarnya dari pencocok adalah antrian tinjauan yang diberi peringkat, bukan seperangkat penggabungan.

Entitas Kunci: Perusahaan: Towards Data Science | Orang: Fellegi, Sunter