HeadlinesBriefing favicon HeadlinesBriefing.com

10 Trampas Estadísticas Comunes para Evitar

Towards Data Science •
×

Hemos estado todos ahí, sentados en una clase universitaria donde un profesor escribe una colección de fórmulas en la pizarra, pidiéndonos memorizarlo ‘porque eso estará en el examen’—cuidando principalmente las calificaciones, incluso si disfruto la materia, porque esa es la forma en que se evalúa a los estudiantes! Una clase así para mí fue estadística. Cuando pienso en clases de estadística, recuerdo una pizarra llena de números y afirmaciones como: calcular la media, encontrar la mediana, trabajar la desviación estándar, dibujar un gráfico, o informar el valor p. Y luego, de alguna manera, se espera que miramos un conjunto de datos y entendamos qué nos está diciendo. Debo admitir que la última parte es donde está la diversión, pero no es como las clases estructuradas presentan estadística. Así que, cuando empecé a aprender por mi cuenta y encontré alegría en descubrir la historia detrás de los datos, encontré la estadística muy divertida. Porque saber cómo calcular una estadística no es lo mismo que entender lo que significa la estadística. Y en un mundo donde estamos constantemente rodeados de números, gráficos, porcentajes, encuestas, estudios y afirmaciones ‘basadas en datos’, saber cómo interpretar datos puede ayudarte a evitar desinformación. Por eso estoy escribiendo este artículo: para explicar mejor 10 cosas sobre la estadística que a menudo se pierden entre las ecuaciones y las preguntas del examen.

1. La media no siempre es el “promedio”

Empecemos con una de las palabras más familiares en estadística: promedio. A menudo usamos ‘promedio’ y ‘media’ de manera intercambiable. Técnicamente, sin embargo, promedio es un término más amplio e informal, mientras que media es una forma particular de describir el centro de un conjunto de datos. Tomemos un ejemplo: imagina a cinco personas ganan: 25k, 27k, 29k, 31k y 33k.

Si consideramos esos cinco números particulares, la media es 29k. Todo parece bastante sensato. Pero ¿qué pasa si cambiamos el salario de la persona con mayor ingreso a 500k? La media de repente se vuelve 122.4k.

La pregunta ahora es, ¿la persona ‘typical’ se convirtió repentinamente en un ingresos de seis cifras? Probablemente responderás, claro que no. Argumentaría que, aunque el cálculo es correcto, la interpretación no es. Por eso necesitamos entender la media está haciendo realmente. Toma todas las observaciones totales y las divide equitativamente entre ellas. La media es por lo tanto particularmente sensible a valores extremos. Ahí es donde entra la mediana! Nos da una perspectiva diferente. Pon las observaciones en orden y toma la del medio. La mediana es 29k en ambos ejemplos! Si consideramos los números como absolutos, ambos números son estadísticamente ‘correctos’, pero están respondiendo preguntas ligeramente diferentes, que es el punto de este artículo. La media pregunta: Si el total se distribuyera equitativamente, ¿qué recibiría cada observación? La mediana pregunta: ¿Qué valor está en el medio de los datos ordenados? Y a veces esa diferencia es toda la historia! Por eso a menudo verás precios de casas, salarios y riqueza informados usando la mediana en lugar de la media. Un pequeño número de valores extremadamente grandes puede arrastrar la media dramáticamente hacia arriba.

2. Un número sin su distribución puede ser engañoso

La estadística también nos enseña a comprimir información. Si se nos dan millones de entradas de datos, necesitaremos comprimirlos en unos pocos números representativos para comunicarlos fácilmente. Aunque esto es útil, también es peligroso. Supongamos que dos clases ambas tienen una puntuación promedio del examen del 70%. A partir de eso solos, asumimos que se desempeñaron de manera similar. Que es una suposición justa, pero no siempre correcta. ¿Qué pasa si las puntuaciones se ven así: Clase A: 65, 68, 69, 70, 71, 72, 75Clase B: 30, 50, 65, 70, 75, 90, 110Ambas podrían tener una media alrededor de 70. Pero estos son claramente no el mismo conjunto de datos. La primera clase está muy agrupada, mientras que la segunda...