HeadlinesBriefing favicon HeadlinesBriefing.com

تصور البيانات: مجموعة بيانات واحدة، قصص متعددة

Towards Data Science •
×

اسمح لي أن أرسم مشهدًا: تحصل على مجموعة بيانات جديدة وتحتاج إلى استكشافها، لذا لا تغير رقمًا واحدًا، ولكنك تصنع ثلاثة تصورات مختلفة. إذا عرضت هذه التصورات على ثلاثة أشخاص مختلفين، فسيغادرون على الأرجح بثلاثة انطباعات مختلفة قليلاً حول معنى البيانات. هذا أحد الأشياء التي أجدها أكثر إثارة للاهتمام في تصور البيانات. غالبًا ما نتحدث عن التصور كما لو كان ببساطة الخطوة الأخيرة في خط أنابيب تحليل البيانات، لكن هذا غير دقيق على الإطلاق! التصور ليس مجرد صورة للبيانات؛ إنه طبقة تفسير بين البيانات والشخص الذي ينظر إليها. هذا يعني أنه عندما نختار مخططًا أو محورًا أو مقياسًا أو تجميعًا أو حتى ما نتركه، فإننا نتخذ قرارات بشأن القصة التي سيرى القارئ.

أي شخص يعمل مع البيانات يعرف أن الجزء الصعب نادرًا ما يكون مجرد وضع رسم بياني على الشاشة. الجزء الصعب هو تحديد الرسم البياني الذي نعرضه. هل يجب أن نركز على الاتجاه؟ الفرق بين المجموعات؟ التباين؟ القيم الشاذة؟ يمكن أن يكون تصوران دقيقين تمامًا ومع ذلك يقودان المشاهد إلى استنتاجات مختلفة جدًا. سؤال مهم هنا: أي مخطط يجب أن أستخدم؟ لكن السؤال الأفضل هو: ما الجانب من البيانات الذي أطلب من القارئ ملاحظته؟

لنفترض أنني أريد تمثيل العلاقة بين مدة تدريب شخص ما وقوته. باستخدام رسم بياني خطي بسيط، يمكنك أن ترى أنه مع زيادة وقت التدريب، تزداد القوة. لكن الخط يجعل العلاقة تبدو مستمرة وخطية تقريبًا. بدلاً من ذلك، يؤكد التمثيل المتدرج على أن القوة تميل إلى الزيادة على مراحل. استخدام مقياس لوغاريتمي للقوة يمكن أن يؤكد على التحسينات الكبيرة في البداية، والمعروفة باسم "مكاسب المبتدئين". لا يوجد مقياس أكثر صدقًا بطبيعته.

يمكننا أن نذهب أبعد من ذلك: يمكن لمخطط الصندوق أن يؤكد على التباين بين جلسات التدريب، ويمكن لمخطط الأعمدة مقارنة فترات تدريب مختلفة، ويمكن لمخطط التشتت إظهار الملاحظات الفردية. الأرقام لم تتغير؛ تفسيرنا تغير، وكذلك الرسالة التي نقدمها.