HeadlinesBriefing favicon HeadlinesBriefing.com

实体关键漂移数据湖模糊匹配

Towards Data Science •
×

大多数 reconciliation 杂乱标识符的人都会采用相同的方法:采用编辑距离度量,选择一个阈值,将任何足够接近的东西合并。Damerau-Levenshtein 对于纯编辑距离而言是显而易见的升级。选择它的理由是合理的。它将转置(两个交换字符)视为一次错误,而不是两次。在 719 个环境传感器站点的拉取中,一处确认的拼写错误是 sds1001 对应 sds011。两个数字被交换了——任何人在键盘上都可能犯的错误。纯编辑距离将其视为两次编辑,同样的价格适用于两个完全不同的产品。Damerau-Levenshtein 则知道这只是一次错误,并且从一开始就将其评分为距离 1。因此它是更好的模型来描述输入错误的发生方式,采用它毫无代价地成本,使其成为最显而易见的选择。

然而,该度量有一个经常被忽视的缺点。下面是一个例子:hdc1008 和 hdc1080 是两个真实的 Texas Instruments 湿度传感器,同时出售,分别记录在不同的 datasheet 上。虽然纯编辑距离将它们置于 2,Damerau-Levenshtein 将其拉到 1 到与前述拼写错误相同的范围。注意,使其在识别人类错误方面更好的同一属性也导致它合并了制造商故意将两个不同产品编号相差一个数字的产品。

这是关于实体关键漂移的深入探索系列的第 2 部分,系列从归一化开始。如果你还没有阅读第 1 部分,它值得一看,因为它覆盖了本篇从 deterministic 清理开始的地方。两者的代码和数据都在 Git Hub 和 Zenodo 上,以防你想自己检查任何数字。在本篇中,我将介绍当我测量五种字符串相似度度量对我从制造商 datasheet 中验证的 ground truth 时发生了什么,为什么它们无法调优来分离拼写错误与真实产品——以及这次失败意味着系统如何被建设的方式。这与任何重新conciliation 短 alphanumeric 标识符 — 产品编号、SKU、模型代码 — 从多个来源都很相关,如果来自单个来源则相关性较小。

关键实体:公司:Texas Instruments

FAQ:文章讨论的标题是什么?

FAQ Q:文章讨论的标题是什么?

FAQ A:避免数据湖中的实体关键漂移:步骤 2,当模糊匹配停止工作