HeadlinesBriefing favicon HeadlinesBriefing.com

Étapes déterministes vs scores similarité

Towards Data Science •
×

La déduplication d'une liste de fournisseurs de 10 000 lignes en Python révèle que la correspondance de chaînes est la partie facile — décider quoi faire des scores de similarité est le vrai travail. L'agence de l'auteur achète des placements éditoriaux auprès d'éditeurs indépendants, et les enregistrements de fournisseurs en double coûtent de l'argent lorsque les factures sont payées deux fois ou que l'historique des prix se divise entre des orthographes que personne ne recherche.

Le même site apparaît sous les formes solartravelmag.com, https://www.solartravelmag.com/, blog.solartravelmag.com et Solar Travel Mag. COM avec des paramètres de suivi. Depuis janvier, un catalogue de marché externe a été synchronisé via son API par-dessus une décennie de saisie manuelle. Un marché admet que ses prix listés correspondent à la réalité environ 90% du temps, rendant la vérification croisée obligatoire.

Une reconstruction synthétique de la liste contenait 11 531 lignes décrivant 7 180 fournisseurs réels, avec 2 429 variantes de surface, 888 lignes de sous-domaine, 529 frères de domaine par pays, 505 fautes de frappe et 180 pièges de noms proches. Deux étapes déterministes — normalisation et effondrement de sous-domaine en utilisant la Public Suffix List — ont supprimé 76% des doublons gratuitement. Le flou matcher a noté 33,7 millions de paires en deux secondes, mais aucun seuil n'a pu fusionner en toute sécurité ce qui restait. La vraie sortie du matcher est une file d'attente de révision classée, pas un ensemble de fusions.

Entités clés : Entreprises : Towards Data Science | Personnes : Fellegi, Sunter