HeadlinesBriefing favicon HeadlinesBriefing.com

欠落値:データにおける隠れた仮定

Towards Data Science •
×

空のセルは、世界の事実であるとみなされるよりも、修正すべき欠陥として扱われることが多い。欠落はデータの生成プロセスを反映しており、単なる不便さだけではない。臨床試験では、離脱者はランダムではない。その多くは治療が失敗したり、症状が悪化したりした患者である。オプショナルの収入項目は、ユーザーがプライバシーを希望する場合にスキップされる。実験で離脱したユーザーは、いつも予想された結果を生み出さず、彼らの欠落は受けた治療と直接関係している可能性がある。

センサーも例外ではない。彼らは回答を拒否できないが、記録は自身が測定する内容によって形成された動作条件に依存する。PM2.5センサーは光散乱を通じて汚染を推定するが、高い粒子負荷がパフォーマンスを低下させ、障害を引き起こす。これは、ネットワークが捕捉しようとした高汚染イベントの正確な期間に欠落が発生することを意味する。

このパターンはインターネット・オブ・オブジェクツでも繰り返される:地震計は地震中にクリップされ、ストレインゲージは重荷重下で故障し、スマートメーターはピークブラックアウト中にレポートを放棄する。

ドナルド・ルービン(1976)は、データの欠落メカニズムを3つに形式化した。データが完全にランダムに欠落(MCAR)するとは、欠落がすべての変数から独立していることを意味する。ランダムに欠落(MAR)とは、欠落が観測された値のみに依存し、適切な条件付けを通じて無バイアス推定が可能であることを意味する。非ランダムに欠落(MNAR)とは、欠落が自ら観測されていない値に依存し、隠された残りの内容について情報を提供することを意味する。

主要エンティティ:企業:インターネット・オブ・オブジェクツ | 人:ドナルド・ルービン、サファロフら