HeadlinesBriefing favicon HeadlinesBriefing.com

10の一般的な統計トラップを回避する方法

Towards Data Science •
×

皆さんも経験があると思いますが、教授がボードに式のコレクションを書き、テストに出るから「memorize」と言う大学の授業で座っているとき—主に点数のため、たとえその科目が好きでも、なぜなら学生はそのように評価されるからです!私の場合、統計の授業がありました。統計の授業を思い浮かべると、ボードに数字と以下のような命令が書かれているのを思い出します:平均を計算し、中央値を求め、標準偏差を計算し、グラフを描き、p-valueを報告する。そして、 somehow、データセットを見て、それが何を伝えているか理解することが期待されています。最後の部分は楽しいと認めなければなりませんが、構造化された授業が統計を提示する方法ではありません。そこで、私は独学で学び始め、データの裏にあるストーリーを見つけて楽しんだとき、統計はとても楽しいと感じました。統計の計算方法を知っているだけでは、統計の意味を理解していることとは限りません。数字、グラフ、パーセント、世論調査、研究、そして「データ駆動」の主張に囲まれた世界で、データの解釈方法を知っていると、誤情報を避けるのに役立ちます。だからこそ、この記事を書いています:方程式と試験問題の間でしばしば見失われがちな統計の10のことをよりよく説明するためです。

1. 平均は常に「平均」ではない

統計学で最も身近な単語の1つから始めましょう:平均。我々はよく「平均」と「mean」を入れ替えて使います。技術的には、しかし、平均はより広い、非公式な用語であり、meanはデータセットの中央を記述する一つの特定の方法です。例えば:5人の人の収入を想像してください:25k、27k、29k、31kそして33k。

これら5つの数字を考えると、meanは29kです。何となく合理的に見えます。しかし、最も収入の高い人の給与を500kに変更してみましょう。mean suddenlyは122.4kになります。

nowの質問は、 「typical」の人は突然六桁の収入者になったのか? おそらくいいえと答えるでしょう。私は主張しますが、計算は正しいかもしれませんが、解釈ではありません。だからこそ、meanが実際に何をしているのかを理解する必要があります。それはすべての観測値の合計を取り、それらに均等に割り当てます。meanはしたがって極端な値に特に敏感です。そこがmedianの出番です! データを順序付けて中央の値を取ります。両方の例ではmedianは29kです! 数字を絶対値として考えると、両方の数字は統計的に「正しい」ですが、少し異なる質問に答えており、これが記事のポイントです。meanは尋ねます:合計が均等に分配された場合、各観測値は何が得るか? medianは尋ねます:順序付けられたデータの中間にある値は何か? そして時には、この違いは物語そのものです! だからこそ、家価格、給与、富はmeanではなくmedianで報告されることが多いのです。極端に大きい値が少数あるだけで、meanを劇的に上方に引っ張ることがあります。

2. 分布なしの数字は誤解を招く可能性がある

統計学はまた、情報を圧縮することを教えます。数百万件のエントリを持つデータセットが与えられると、簡単に伝えるために代表的な数少ない数に圧縮する必要があります。これは便利ですが、同時に危険でもあります。両方のクラスの平均テストスコアが70%であると仮定します。それだけで、同様にパフォーマンスしたと仮定します。これは公平な仮定ですが、常に正しいとは限りません。スコアがこのように見える場合:Class A: 65, 68, 69, 70, 71, 72, 75Class B: 30, 50, 65, 70, 75, 90, 110両方ともmeanは約70になる可能性があります。しかし、これらは明らかに同じデータセットではありません。第一クラスは締め付けられており、第二クラスは...