HeadlinesBriefing favicon HeadlinesBriefing.com

Детерминированные этапы vs оценки схожести

Towards Data Science •
×

Дедупликация списка поставщиков из 10 000 строк на Python показывает, что сопоставление строк — это легкая часть — решение о том, что делать с оценками схожести, является настоящей работой. Агентство автора покупает редакционные размещения у независимых издателей, и дублирующиеся записи поставщиков стоят денег, когда счета оплачиваются дважды или история цен разделяется между написаниями, которые никто не ищет.

Тот же сайт отображается как solartravelmag.com, https://www.solartravelmag.com/, blog.solartravelmag.com и Solar Travel Mag. COM с параметрами отслеживания. С января внешний каталог маркетплейса синхронизируется через его API поверх десятилетия ручного ввода. Один маркетплейс признается, что его указанные цены соответствуют реальности примерно 90% времени, что делает перекрестную проверку обязательной.

Синтетическая перестройка списка содержала 11 531 строк, описывающих 7 180 реальных поставщиков, с 2 429 поверхностными вариантами, 888 строками поддоменов, 529 братьями-доменами по странам, 505 опечатками и 180 ловушками с похожими именами. Два детерминированных этапа — нормализация и свертывание поддоменов с использованием Public Suffix List — устранили 76% дублей бесплатно. Нечеткий сопоставитель оценил 33,7 миллиона пар за две секунды, но ни один порог не мог безопасно объединить оставшееся. Реальный выход сопоставителя — это ранжированная очередь на рассмотрение, а не набор слияний.

Ключевые сущности: Компании: Towards Data Science | Люди: Fellegi, Sunter