HeadlinesBriefing favicon HeadlinesBriefing.com

Нечеткое совпадение Entity Key Drift в Data Lake

Towards Data Science •
×

Большинство людей, которые согласовывают беспорядочные идентификаторы, достигают одного и того же подхода: берут метрику расстояния редактирования, выбирают порог и объединяют всё, что достаточно близко. Damerau-Levenshtein — это очевидное обновление по сравнению с простым расстоянием редактирования. Обоснование выбора этого метода обдумано. Он рассматривает транспозицию (два переставленных символа) как одну ошибку вместо двух. При выборе 719 станций экологических датчиков была подтверждена одна опечатка: sds1001 вместо sds011. Два символа были переставлены местами — ошибка, которую может совершить любой человек на клавиатуре. Обычное расстояние редактирования воспринимает это как два редактирования, такую же цену, которую бы наложило на два совершенно разных продукта. Damerau-Levenshtein же понимает, что это одна ошибка, и с самого начала оценивает её как расстояние 1. Поэтому это лучшая модель того, как происходят опечатки, и её использовать не обходится никаких затрат, делая её самым очевидным выбором.

Однако у этой метрики часто упускается из виду один недостаток. Вот пример: hdc1008 и hdc1080 — это два настоящих датчика влажности от Texas Instruments, продаваемых в то же время, задокументированных на отдельных листах данных. Хотя обычное расстояние редактирования помещает их на уровень 2, Damerau-Levenshtein опускает их до 1 в том же диапазоне, что и упомянутые ранее опечатки. Обратите внимание, как та же самая особенность, делающая её лучше в распознавании человеческих ошибок, также заставляет её объединять два совершенно разных продукта, которые производитель специально пронумеровал с разницей в один символ.

Это часть 2 моего сериального глубокого погружения в entity key drift, который начинается с нормализации. Если вы ещё не читали часть 1, стоит посмотреть на неё первой, поскольку она охватывает детерминированную очистку, с которой начинается эта статья. Код и данные обоих доступны на Git Hub и Zenodo, на всякий случай, если вы хотите проверить любые цифры самостоятельно. В этой статье я расскажу, что произошло, когда я измерял пять метрик сходства строк против проверенной той истинной выборки, которую я получил из листов данных производителя, почему ни одна из них не могла быть настроена, чтобы отделить опечатки от реальных продуктов — и что это значит для того, как должен быть построен системный подход вместо этого. Это актуально для кого-либо, кто согласовывает короткие буквенно-цифровые идентификаторы — номера деталей, артикулы, коды моделей — из более чем одного источника, и меньше, если они поступают из одного источника.

Ключевые сущности: Компании: Texas Instruments