HeadlinesBriefing favicon HeadlinesBriefing.com

10 فخوط إحصائية شائعة لتجنبها

Towards Data Science •
×

كنا جميعا في هذا الموقف، جالسين في فصل جامعي حيث يكتب المعلم مجموعة من الصيغ على اللوحة، طالبين منا الحفظ ‘لأنه سيظهر في الامتحان’—معظمًا بشأن الدرجات، حتى لو استمتعنا بالمادة، لأن هذه هي الطريقة التي يتم بها تقييم الطلاب! كانت لدي فصل إحصائي عندما أفكر في فصول الإحصاء، أتذكر доску مليئة بالأرقام والتصريحات مثل: احسب المتوسط، عيّن الوسيط، احسب الانحراف المعياري، ارسم مخططًا، أو أبلغ عن قيمة p. وبعد ذلك، somehow، ننتظر أن ننظر إلى مجموعة بيانات ونفهم ما هي تخبرنا به. يجب أن أعترف أن الجزء الأخير هو حيث المتعة، ولكن ليس كيف تقدم الفصول المنظمة الإحصاء. لذا، عندما بدأت التعلم الذاتي ووجدت متعة في معرفة القصة وراء البيانات، وجدت الإحصاء ممتعًا. لأن معرفة كيفية حساب إحصاء ليست هي نفسها فهم ما يعنيه الإحصاء. وفي عالم حيث نكون constantemente surrounded بالأرقام، والرسوم البيانية، والنسب المئوية، والاستطلاعات، والدراسات، والادعاءات ‘المبنية على البيانات'، معرفة كيفية تفسير البيانات يمكن أن تساعدك على تجنب المعلومات الخاطئة. ولهذا أنا أكتب هذا المقال: لتفسير أفضل 10 أشياء عن الإحصاء التي غالبًا ما تضيع بين المعادلات وأسئلة الامتحان.

1. المتوسط ليس دائمًا “المتوسط”

لنبدأ مع أحد أكثر الكلمات شيوعًا في الإحصاء: المتوسط. غالبًا ما نستخدم ‘المتوسط’ و‘المعيار’ بشكل متبادل. Technically، however، المتوسط هو مصطلح أوسع وأقل رسمية، بينما المعياري هو طريقة particulière لوصف مركز مجموعة بيانات. لنأخذ مثالًا: تخيل خمسة أشخاص يكسبون: 25k، 27k، 29k، 31k و 33k.

إذا اعتبرنا تلك الأرقام الخمسة الخاصة، فإن المتوسط هو 29k. يبدو الأمر معقولًا إلى حد كبير. ولكن ماذا لو غيّرنا راتب الشخص صاحب أعلى دخل إلى 500k؟ أصبح المتوسط فجأة 122.4k.

والسؤال الآن هو، هل أصبح الشخص ‘typical’ فجأة كسبًا بستة أرقام؟ ستجيب على الأرجح، بالتأكيد لا. لأجادل أن، aunque الحساب صحيح، التفسير ليس كذلك. ولهذا necesitamos فهم ما يفعله المتوسط بالفعل. يأخذ إجمالي جميع الملاحظات ويقسمها بالتساوي بينها. المتوسط هو لذلك particularmente حساس للقيم المتطرفة. وهنا يأتي دور الوسيط! يعطينا منظورًا مختلفًا. رتب الملاحظات بالترتيب وضع الأوسط. الوسيط هو 29k في كلا المثالين! إذا اعتبرنا الأرقام كمطلقات، فكلاهما إحصائيًا ‘صحيح'، لكنهما يجيبان عن أسئلة مختلفة قليلاً، وهذا هو نقطة هذا المقال. المتوسط يسأل: إذا تم توزيع الإجمالي بالتساوي، ماذا سيحصل كل ملاحظة؟ الوسيط يسأل: ما القيمة التي تقع في المنتصف من البيانات المرتبة؟ وأحيانًا تكون هذه الاختلاف هي القصة بأكملها! ولهذا غالبًا ما ترى أسعار المنازل، الرواتب، والثروة تُبلغ باستخدام الوسيط بدلاً من المتوسط. مجموعة صغيرة من القيم الكبيرة للغاية يمكن أن تسحب المتوسط بشكل dramatice نحو الأعلى.

2. رقم بدون توزيعه يمكن أن يكون مضللاً

تعلمنا الإحصاء أيضًا على ضغط المعلومات. إذا تم إعطاؤنا مجموعات بيانات بمليون مدخلات، سنحتاج إلى ضغطها إلى بضعة أرقامrepresentative لنقلها بسهولة. على الرغم من أن هذا مفيد، إلا أنه أيضًا خطير. افترض أن فصلين كلاهما متوسط درجات الامتحان 70%. من ذلك alone، نAssume أنهم أدىوا بشكل مشابه. Which is a fair assumption, but not always a correct one. ماذا لو كانت الدرجات تبدو هكذا: فصل أ: 65، 68، 69، 70، 71، 72، 75فصل ب: 30، 50، 65، 70، 75، 90، 110يمكن أن يكون لهما متوسط حول 70. لكن هذه بالتأكيد ليست نفس مجموعة البيانات. الفصل الأول مضغوط، بينما الثاني...