HeadlinesBriefing favicon HeadlinesBriefing.com

決定論的ステージ vs 類似度スコア

Towards Data Science •
×

Pythonで10,000行のサプライヤーリストを重複排除すると、文字列マッチングは簡単な部分であり、類似度スコアをどう扱うか決めるのが本当の仕事だとわかります。著者のエージェンシーは独立系パブリッシャーから編集掲載枠を購入しており、重複したサプライヤーレコードは、請求書が二重払いされたり、誰も検索しないスペル違いによって価格履歴が分断されたりするとコストが発生します。

同じサイトが solartravelmag.com、https://www.solartravelmag.com/、blog.solartravelmag.com、トラッキングパラメータ付きの Solar Travel Mag. COM として表示されます。1月から、外部マーケットプレイスカタログがそのAPIを通じて10年間の手動入力の上に同期されています。あるマーケットプレイスは、掲載価格が現実と約90%一致すると認めており、相互確認が必須となっています。

リストの合成再構築には11,531行が含まれ、7,180の実際のベンダーを記述しており、2,429の表面変異、888のサブドメイン行、529の国別ドメイン兄弟、505のタイポ、180の類似名トラップがありました。2つの決定論的ステージ — パブリックサフィックスリストを使用した正規化とサブドメインの統合 — により、無料で76%の重複が除去されました。ファジーマッチャーは3,370万ペアを2秒でスコアリングしましたが、どの閾値でも残りを安全にマージできませんでした。マッチャーの真の出力はランク付けされたレビューキューであり、マージのセットではありません。

主要エンティティ: 企業: Towards Data Science | 人物: Fellegi, Sunter