HeadlinesBriefing favicon HeadlinesBriefing.com

10 Типичных Статистических Ловушек, которых Стоит Избегать

Towards Data Science •
×

Мы все были в этом положении, сидя в университете, где профессор пишет на доске набор формул, прося нас запомнить ‘потому что это будет на экзамене’—в основном за grades, даже если я люблю предмет, потому что так оценивают студентов! Одна из таких классов для меня была статистикой. Когда я думаю о статистических классах, я помню доску с числами и утверждениями вроде: посчитать среднее значение, найти медиану, вычислить стандартное отклонение, нарисовать график или сообщить о p-value. И потом, somehow, мы ожидаем, что посмотрим на набор данных и поймем, что он нам говорит. Мне приходится признавать, что последняя часть — где есть веселье, но так структурированные курсы не представляют статистику. Поэтому, когда я начал учиться сам и нашел радость в том, чтобы разобраться в истории за данными, я нашел статистику очень интересной. Потому что знать, как посчитать статистику, не то же самое, что понимать, что она означает. И в мире, где мы постоянно окружены числами, графиками, процентами, опросами, исследованиями и ‘данными-driven’ утверждениями, знание того, как интерпретировать данные, может помочь вам избежать дезинформации. Именно поэтому я пишу эту статью: чтобы лучше объяснить 10 вещей о статистике, которые часто упускаются между уравнениями и вопросами экзаменов.

1. Среднее не всегда “среднее”

Давайте начнем с одного из самых известных слов в статистике: среднее. Мы часто используем ‘среднее’ и ‘mean’ взаимозаменяемо. Technically, однако, среднее — это более широкий, неофициальный термин, а mean — одно из конкретных описаний центра набора данных. Возьмем пример: представьте, что пять человек зарабатывают: 25k, 27k, 29k, 31k и 33k.

Если мы рассматриваем эти пять чисел, то среднее составляет 29k. Всё выглядит довольно разумно. Но что, если мы изменим зарплату самого высокооплачиваемого человека на 500k? Среднее Suddenly становится 122.4k.

Вопрос теперь в том, стал ли ‘typical’ человек внезапно шестизначным заработком? Вы, вероятно, ответите, конечно нет. Я бы argued, что, хотя вычисление верно, интерпретация неверна. Именно поэтому нам нужно понимать, что делает среднее. Она берет общую сумму всех наблюдений и делит её поровну между ними. Среднее поэтому особенно чувствительно к экстремальным значениям. Вот где вступает в игру медиана! Она дает нам другой взгляд. Посчитайте наблюдения в порядке и возьмите средний. Медиана составляет 29k в обоих примерах! Если мы считаем числа как абсолютные значения, то оба числа статистически ‘правильны’, но они отвечают немного на разные вопросы, и это и есть суть этой статьи. Среднее спрашивает: Если бы общая сумма распределялась поровну, что получило бы каждое наблюдение? Медиана спрашивает: Какое значение находится в середине упорядоченных данных? И иногда это различие — вся история! Именно поэтому часто можно увидеть цены на дома, зарплаты и богатство, сообщаемые с использованием медианы вместо среднего. Небольшое количество очень больших значений может драматически тянуть среднее вверх.

2. Число без своего распределения может ввести в заблуждение

Статистика также учит нас сжимать информацию. Если нам дают наборы данных с миллионами записей, нам нужно сжать их в несколько репрезентативных чисел, чтобы легко ихcommunicate. Хотя это полезно, это также опасно. Представьте, что у двух классов средний балл на экзамене 70%. Только с этого, мы предполагаем, что они вели себя аналогично. Which is a fair assumption, but not always a correct one. Что если оценки выглядят так: Класс А: 65, 68, 69, 70, 71, 72, 75Класс Б: 30, 50, 65, 70, 75, 90, 110Оба могут иметь среднее около 70. Но эти явно не та же самая набор данных. Первый класс плотный, а второй...