HeadlinesBriefing favicon HeadlinesBriefing.com

エンティティキー・ドリフト・データレイク・ファジーマッチング

Towards Data Science •
×

エンティティの一体化で雑散な識別子を調整する人はほとんどが同じアプローチを取ります:編集距離の指標を選び、しきい値を決め、十分近いものをマージします。Damerau-Levenshteinは単純な編集距離の明らかな上位互換です。選択する理由は妥当です。転置(2つの文字が入れ替わったもの)を2つのエラーではなく1つのエラーとして扱います。719の環境センサー駅のプルの中で、確認された1つのタイポはsds1001をsds011のための誤記でした。2つの数字が入れ替わったのは、キーボードで誰でもやりがちなミスです。単純な編集距離はこれを2つの編集として扱い、2つの全く異なる製品に対して同じ価格を請求するのと同じです。Damerau-Levenshteinはそれは1つのエラーであることを知り、最初から距離1として評価します。したがって、タイポがどのように発生するかをモデル化する上で優れており、採用するためのコストが全くかからないため、最も明らかな選択肢となります。

しかし、この指標にはしばしば見逃されがちな欠点があります。ここに例を示します:hdc1008とhdc1080は、同時に販売され、別々のデータシートに記載された2つの実在するTexas Instrumentsの湿度センサーです。単純な編集距離はそれらを2として配置しますが、Damerau-Levenshteinは前述のタイポと同じ範囲につなぎ降ろします。人間のエラーを認識する上で優れているという同じ特性が、製造元が意図的に1桁だけ異なる2つの異なる製品をマージしてしまうのです。

これは正規化から始まるエンティティキー・ドリフトに関する私の深掘りシリーズの第2部です。Part 1をまだ読んでいない場合は、最初にチェックしてみる価値があります。それはこの記事が引き継ぐ決定的なクリーンアップをカバーしています。両方のコードとデータはGit HubとZenodoにありますので、自分で数値を確認したい場合はご覧ください。この記事では、製造元のデータシートから私が確認したground truthに対して5つの文字列類似度指標を測ったときに何が起こったのか、なぜそれらのいずれもタイポを実際の製品から分離するためにチューニングできなかったのか、そしてその失敗がシステムをどのように構築すべきかを説明します。これは、複数のソースから短い英数字識別子—部品番号、SKU、モデルコード—を調整する人に関連し、単一のソースから来る場合はやや関連性が低いです。

キーエンティティ:企業:Texas Instruments

FAQ:テキストで議論された記事のタイトルは何ですか?

FAQ Q:テキストで議論された記事のタイトルは何ですか?

FAQ A:データレイクでのエンティティキー・ドリフトを回避する:ステップ2、ファジーマッチングが動作を停止する時