HeadlinesBriefing favicon HeadlinesBriefing.com

缺失值:数据中的隐藏假设

Towards Data Science •
×

空白单元格往往被当作需要修复的缺陷,而非世界的事实。缺失情况反映了数据生成的过程,而不仅仅是一种便利问题。在临床试验中,退出者并非随机发生——他们往往是治疗失败或病情恶化的患者。可选的收入字段在用户希望保护隐私时会被跳过。在实验中的流失用户从不会产生预期的效果,他们的缺失可能直接与所接收的处理有关。

传感器也并不幸免。虽然它们无法拒绝作答,但其记录依赖于受其自身所测量结果影响的运行条件。PM2.5传感器通过光散射估计污染水平,但高颗粒物负载会降低性能并导致故障。这意味着在网络设计用于捕捉的高污染事件期间,数据缺失恰恰发生。

这一模式在互联网物联网设备中屡次出现:地震仪在地震期间削波,应变计在重载下失效,智能电表在峰值停电期间丢弃报告。

Donald Rubin(1976)正式定义了三种缺失机制。数据在完全随机缺失(MCAR)时,缺失与所有变量无关。随机缺失(MAR)意味着缺失仅取决于已观察到的值,通过适当的条件化可以实现无偏估计。非随机缺失(MNAR)发生在缺失取决于自身未观察到的值时,这种缺失对剩余隐藏内容本身是信息性的。

关键实体:公司:互联网物联网 | 人:Donald Rubin,Safarov等