HeadlinesBriefing favicon HeadlinesBriefing.com

Пропущенные значения: Скрытые предположения в данных

Towards Data Science •
×

Пустая ячейка часто рассматривается как дефект, который нужно исправить, а не факт о мире. Отсутствие данных отражает процесс, создающий данные, а не просто неудобство. В клинических испытаниях отказы не являются случайными; это часто пациенты, у которых лечение не удалось или состояние ухудшилось. Поля с доходом по опции пропускаются, когда пользователи предпочитают конфиденциальность. Пользователи, покинувшие эксперимент, никогда не достигают ожидаемого результата, и их отсутствие может быть напрямую связано с полученным лечением.

Сенсоры тоже не устранены от нечувствительности. Хотя они не могут отказать в ответе, их запись зависит от условий эксплуатации, формируемых тем, что они измеряют. Сенсор PM2.5 оценивает загрязнение путем рассеяния света, но высокая нагрузка частиц снижает производительность и вызывает сбои. Это означает, что пробелы возникают именно во время событий высокой загрязненности, которые сеть была создана для захвата.

Этот паттерн повторяется во Интернете вещей: сейсмометры отрезаются во время землетрясений, датчики напряжения выходят из строя под тяжелой нагрузкой, а умные счетчики бросают отчеты во время пиковых отключений электроэнергии.

Дональд Рубин (1976) формализовал три механизма пропуска данных. Данные находятся полностью случайно в пропуске (MCAR), когда пробел независим от всех переменных. Случайно в пропуске (MAR) означает, что пробелы зависят только от наблюдаемых значений, позволяя получить несмещенную оценку через правильное условное моделирование. Не случайно в пропуске (MNAR) происходит, когда пробел зависят самого не наблюдаемого значения, делая отсутствие информативным о том, что остается скрытым.

Ключевые сущности: Компании: Интернет вещей | Люди: Дональд Рубин, Сафаров и др.