HeadlinesBriefing favicon HeadlinesBriefing.com

Valores faltantes: Suposiciones ocultas en los datos

Towards Data Science •
×

Una celda en blanco a menudo se trata como un defecto a corregir en lugar de un hecho sobre el mundo. La ausencia de datos refleja el proceso que genera los datos, no solo una inconveniencia. En los ensayos clínicos, los pacientes que se retiran no son aleatorios; a menudo son pacientes cuyo tratamiento falló o cuya condición empeoró. Los campos de ingresos opcionales se omiten cuando los usuarios prefieren privacidad. Los usuarios que se van en experimentos nunca producen el resultado previsto, y su ausencia puede estar relacionada directamente con el tratamiento recibido.

Los sensores tampoco son inmunes. Aunque no pueden negarse a responder, su registro depende de condiciones de funcionamiento moldeadas por lo que miden. Un sensor PM2.5 estima la contaminación mediante dispersión de luz, pero la alta carga de partículas degrada el rendimiento y causa fallas. Esto significa que las brechas ocurren precisamente durante los eventos de alta contaminación que la red estaba diseñada para capturar.

Este patrón se repite en el Internet de las Cosas: los sismógrafos se recortan durante terremotos, los gajos de tensión fallan bajo cargas pesadas, y los medidores inteligentes abandonan informes durante los picos de apagones.

Donald Rubin (1976) formalizó tres mecanismos de ausencia de datos. Los datos están faltando completamente al azar (MCAR) cuando la brecha es independiente de todas las variables. Falta al azar (MAR) significa que las brechas dependen solo de valores observados, permitiendo una estimación no sesgada mediante una condicionalización adecuada. Falta no al azar (MNAR) ocurre cuando la brecha depende del valor no observado en sí, lo que hace que la ausencia sea informativa sobre lo que permanece oculto.

Entidades clave: Empresas: Internet de las Cosas | Personas: Donald Rubin, Safarov et al.