HeadlinesBriefing favicon HeadlinesBriefing.com

10 Pièges Statistiques Courants à Éviter

Towards Data Science •
×

Nous avons tous été là, assis dans une classe universitaire où un professeur écrit une collection de formules sur le tableau, nous demandant de mémoriser cela ‘parce que cela sera à l'examen'—en nous souciant principalement des notes, même si j'apprécie la matière, car c'est ainsi que les étudiants sont évalués ! Une telle classe pour moi était les statistiques. Quand je pense aux cours de statistiques, je me souviens d'un tableau rempli de nombres et d'affirmations comme : calculer la moyenne, trouver la médiane, calculer l'écart-type, tracer un graphique, ou signaler la valeur p. Et puis, somehow, on s'attend à regarder un ensemble de données et à comprendre ce qu'il nous dit. Dois-je avouer que la dernière partie est où se trouve le plaisir, mais ce n'est pas ainsi que les cours structurés présentent les statistiques. Alors, quand j'ai commencé à apprendre tout seul et j'ai trouvé du plaisir à découvrir l'histoire derrière les données, j'ai trouvé les statistiques très amusantes. Parce que savoir calculer une statistique n'est pas la même chose que comprendre ce que signifie la statistique. Et dans un monde où nous sommes constamment entourés de nombres, de graphiques, de pourcentages, d'enquêtes, d'études et de revendications ‘basées sur les données', savoir interpréter les données peut vous aider à éviter la désinformation. C'est pourquoi j'écris cet article : pour mieux expliquer 10 choses sur les statistiques qui sont souvent perdues entre les équations et les questions d'examen.

1. La moyenne n'est pas toujours la “moyenne”

Commençons avec l'un des mots les plus familiers en statistiques : moyenne. Nous utilisons souvent ‘moyenne’ et ‘moyenne’ de manière interchangeable. Techniquement, cependant, moyenne est un terme plus large et informel, tandis que moyenne est une manière particulière de décrire le centre d'un ensemble de données. Prenons un exemple : imaginez cinq personnes gagnent : 25k, 27k, 29k, 31k et 33k.

Si nous considérons ces cinq nombres particuliers, la moyenne est 29k. Tout semble assez sensé. Mais que se passe-t-il si nous changeons le salaire de la personne aux revenus les plus élevés à 500k ? La moyenne devient soudainement 122.4k.

La question maintenant est, la personne ‘typique' est-elle soudainement devenue un gagnant à six chiffres ? Vous répondrez probablement, bien sûr pas. Je soutiendrais que, bien que le calcul soit correct, l'interprétation ne l'est pas. C'est pourquoi nous devons comprendre ce que la moyenne fait réellement. Elle prend le total de toutes les observations et la divise également parmi elles. La moyenne est donc particulièrement sensible aux valeurs extrêmes. C'est là que la médiane intervient ! Elle nous donne une perspective différente. Rangez les observations dans l'ordre et prenez la au milieu. La médiane est 29k dans les deux exemples ! Si nous considérons les nombres comme des absolus, les deux nombres sont statistiquement ‘corrects', mais ils répondent à des questions légèrement différentes, c'est le point de cet article. La moyenne demande : Si le total était distribué équitablement, que recevrait chaque observation ? La médiane demande : Quelle valeur se situe au milieu des données ordonnées ? Et parfois, cette différence est toute l'histoire ! C'est pourquoi vous verrez souvent les prix des maisons, les salaires et la richesse rapportés à l'aide de la médiane plutôt que de la moyenne. Un petit nombre de valeurs extrêmement grandes peut tirer la moyenne vers le haut de manière dramatiquement.

2. Un nombre sans sa distribution peut être trompeur

La statistique nous apprend également à compresser l'information. Si nous sommes donnés des ensembles de données avec des millions d'entrées, nous devrons les compresser en quelques nombres représentatifs pour les communiquer facilement. Bien que cela soit utile, c'est aussi dangereux. Supposons que deux classes aient toutes les deux une note moyenne d'examen de 70%. À partir de cela seul, nous supposons qu'ils ontPerformed de manière similaire. Which is a fair assumption, but not always a correct one. Que se passe-t-il si les notes ressemblent à ceci : Classe A : 65, 68, 69, 70, 71, 72, 75Classe B : 30, 50, 65, 70, 75, 90, 110Les deux pourraient avoir une moyenne autour de 70. Mais ces sont clairement pas le même jeu de données. La première classe est serrée, tandis que la seconde...