HeadlinesBriefing HeadlinesBriefing 12 languages

How Many Stories Can Your Data Tell?

Towards Data Science ·

🇬🇧 English

Allow me to paint a scene: you get a new dataset and need to explore it, so you don’t change a single number, but you make three different visualizations. If you showed those visualizations to three different people, they'd likely walk away with three slightly different impressions of what the data means. That is one of the things I find most fascinating about data visualization. We often talk about visualization as if it were simply the final step in a data-analysis pipeline, but that is not accurate at all! Visualization isn't just a picture of the data; it is an interpretation layer between the data and the person looking at it. That means when we choose a chart, an axis, a scale, a grouping, or even what to leave out, we are making decisions about the story the reader will see.

Anyone who works with data knows that the difficult part is rarely just getting a graph onto the screen. The difficult part is deciding which graph we show. Should we focus on the trend? The difference between groups? The variability? The outliers? Two visualizations can be completely accurate and still lead the viewer toward very different conclusions. One important question here is: Which chart should I use? But a better question is: What aspect of the data am I asking the reader to notice?

Suppose I want to represent the relationship between how long someone has been training and their strength. Using a simple line graph, you can see that as training time increases, strength increases. But the line makes the relationship look continuous and almost linear. Instead, a step-like representation emphasizes that strength tends to increase in stages. Using a logarithmic scale for strength can emphasize large improvements early on, known as "newbie gains." Neither scale is inherently more truthful.

We can go even further: a box plot could emphasize variability across training sessions, a bar chart could compare different training periods, and a scatter plot could show individual observations. The numbers haven’t changed; our interpretation has, and so has the message we're delivering.

View original article →


🇸🇦 العربية

كم عدد القصص التي يمكن لبياناتك أن ترويها؟

اسمح لي أن أرسم مشهدًا: تحصل على مجموعة بيانات جديدة وتحتاج إلى استكشافها، لذا لا تغير رقمًا واحدًا، ولكنك تصنع ثلاثة تصورات مختلفة. إذا عرضت هذه التصورات على ثلاثة أشخاص مختلفين، فسيغادرون على الأرجح بثلاثة انطباعات مختلفة قليلاً حول معنى البيانات. هذا أحد الأشياء التي أجدها أكثر إثارة للاهتمام في تصور البيانات. غالبًا ما نتحدث عن التصور كما لو كان ببساطة الخطوة الأخيرة في خط أنابيب تحليل البيانات، لكن هذا غير دقيق على الإطلاق! التصور ليس مجرد صورة للبيانات؛ إنه طبقة تفسير بين البيانات والشخص الذي ينظر إليها. هذا يعني أنه عندما نختار مخططًا أو محورًا أو مقياسًا أو تجميعًا أو حتى ما نتركه، فإننا نتخذ قرارات بشأن القصة التي سيرى القارئ.

أي شخص يعمل مع البيانات يعرف أن الجزء الصعب نادرًا ما يكون مجرد وضع رسم بياني على الشاشة. الجزء الصعب هو تحديد الرسم البياني الذي نعرضه. هل يجب أن نركز على الاتجاه؟ الفرق بين المجموعات؟ التباين؟ القيم الشاذة؟ يمكن أن يكون تصوران دقيقين تمامًا ومع ذلك يقودان المشاهد إلى استنتاجات مختلفة جدًا. سؤال مهم هنا: أي مخطط يجب أن أستخدم؟ لكن السؤال الأفضل هو: ما الجانب من البيانات الذي أطلب من القارئ ملاحظته؟

لنفترض أنني أريد تمثيل العلاقة بين مدة تدريب شخص ما وقوته. باستخدام رسم بياني خطي بسيط، يمكنك أن ترى أنه مع زيادة وقت التدريب، تزداد القوة. لكن الخط يجعل العلاقة تبدو مستمرة وخطية تقريبًا. بدلاً من ذلك، يؤكد التمثيل المتدرج على أن القوة تميل إلى الزيادة على مراحل. استخدام مقياس لوغاريتمي للقوة يمكن أن يؤكد على التحسينات الكبيرة في البداية، والمعروفة باسم "مكاسب المبتدئين". لا يوجد مقياس أكثر صدقًا بطبيعته.

يمكننا أن نذهب أبعد من ذلك: يمكن لمخطط الصندوق أن يؤكد على التباين بين جلسات التدريب، ويمكن لمخطط الأعمدة مقارنة فترات تدريب مختلفة، ويمكن لمخطط التشتت إظهار الملاحظات الفردية. الأرقام لم تتغير؛ تفسيرنا تغير، وكذلك الرسالة التي نقدمها.

كيف يمكن لتصورات مختلفة لنفس البيانات أن تروي قصصًا مختلفة؟

بتغيير أنواع المخططات أو المحاور أو المقاييس أو التجميعات، فإنك تؤكد على جوانب مختلفة من البيانات، مما يؤدي بالمشاهدين إلى تفسيرات مختلفة حتى عندما تظل الأرقام الأساسية دون تغيير.

العربية version →


🇧🇩 বাংলা

আপনার ডেটা কতগুলো গল্প বলতে পারে?

আমাকে একটি দৃশ্য আঁকতে দিন: আপনি একটি নতুন ডেটাসেট পান এবং এটি অন্বেষণ করতে হবে, তাই আপনি একটি সংখ্যাও পরিবর্তন করেন না, কিন্তু তিনটি ভিন্ন ভিজুয়ালাইজেশন তৈরি করেন। যদি আপনি সেই ভিজুয়ালাইজেশন তিনটি ভিন্ন লোককে দেখান, তারা সম্ভবত ডেটার অর্থ সম্পর্কে তিনটি সামান্য ভিন্ন ধারণা নিয়ে চলে যাবে। এটি এমন একটি জিনিস যা আমি ডেটা ভিজুয়ালাইজেশন সম্পর্কে সবচেয়ে আকর্ষণীয় মনে করি। আমরা প্রায়শই ভিজুয়ালাইজেশন সম্পর্কে কথা বলি যেন এটি ডেটা-বিশ্লেষণ পাইপলাইনের শেষ ধাপ, কিন্তু এটি মোটেও সঠিক নয়! ভিজুয়ালাইজেশন শুধু ডেটার একটি ছবি নয়; এটি ডেটা এবং যে ব্যক্তি এটি দেখছে তার মধ্যে একটি ব্যাখ্যা স্তর। এর অর্থ হল যখন আমরা একটি চার্ট, একটি অক্ষ, একটি স্কেল, একটি গ্রুপিং, বা এমনকি কী বাদ দিতে হবে তা নির্বাচন করি, আমরা পাঠক যে গল্প দেখবে সে সম্পর্কে সিদ্ধান্ত নিচ্ছি।

যে কেউ ডেটা নিয়ে কাজ করে সে জানে যে কঠিন অংশটি খুব কমই শুধু স্ক্রিনে একটি গ্রাফ আনা। কঠিন অংশটি হল কোন গ্রাফ দেখাব তা নির্ধারণ করা। আমাদের কি প্রবণতার উপর ফোকাস করা উচিত? গোষ্ঠীগুলির মধ্যে পার্থক্য? পরিবর্তনশীলতা? আউটলায়ার? দুটি ভিজুয়ালাইজেশন সম্পূর্ণ নির্ভুল হতে পারে এবং তবুও দর্শককে খুব ভিন্ন সিদ্ধান্তে নিয়ে যেতে পারে। এখানে একটি গুরুত্বপূর্ণ প্রশ্ন হল: আমার কোন চার্ট ব্যবহার করা উচিত? কিন্তু একটি ভাল প্রশ্ন হল: আমি পাঠককে ডেটার কোন দিকটি লক্ষ্য করতে বলছি?

ধরুন আমি কারও প্রশিক্ষণের সময় এবং তাদের শক্তির মধ্যে সম্পর্ক উপস্থাপন করতে চাই। একটি সাধারণ লাইন গ্রাফ ব্যবহার করে, আপনি দেখতে পারেন যে প্রশিক্ষণের সময় বাড়ার সাথে সাথে শক্তি বৃদ্ধি পায়। কিন্তু লাইনটি সম্পর্কটিকে ধারাবাহিক এবং প্রায় রৈখিক দেখায়। পরিবর্তে, একটি ধাপ-সদৃশ উপস্থাপনা জোর দেয় যে শক্তি পর্যায়ক্রমে বৃদ্ধি পায়। শক্তির জন্য একটি লগারিদমিক স্কেল ব্যবহার প্রাথমিক বড় উন্নতির উপর জোর দিতে পারে, যা "নিউবি গেইনস" নামে পরিচিত। কোন স্কেলই স্বাভাবিকভাবে বেশি সত্য নয়।

আমরা আরও এগিয়ে যেতে পারি: একটি বক্স প্লট প্রশিক্ষণ সেশনের মধ্যে পরিবর্তনশীলতার উপর জোর দিতে পারে, একটি বার চার্ট বিভিন্ন প্রশিক্ষণ সময়কাল তুলনা করতে পারে, এবং একটি স্ক্যাটার প্লট পৃথক পর্যবেক্ষণ দেখাতে পারে। সংখ্যাগুলি পরিবর্তিত হয়নি; আমাদের ব্যাখ্যা পরিবর্তিত হয়েছে, এবং আমাদের বার্তাও।

একই ডেটার বিভিন্ন ভিজুয়ালাইজেশন কীভাবে বিভিন্ন গল্প বলতে পারে?

চার্টের ধরন, অক্ষ, স্কেল বা গ্রুপিং পরিবর্তন করে, আপনি ডেটার বিভিন্ন দিকের উপর জোর দেন, যা দর্শকদের বিভিন্ন ব্যাখ্যায় নিয়ে যায়, এমনকি অন্তর্নিহিত সংখ্যাগুলি অপরিবর্তিত থাকলেও।

বাংলা version →


🇩🇪 Deutsch

Wie viele Geschichten können Ihre Daten erzählen?

Lassen Sie mich eine Szene malen: Sie erhalten einen neuen Datensatz und müssen ihn erkunden, also ändern Sie keine einzige Zahl, aber erstellen drei verschiedene Visualisierungen. Wenn Sie diese Visualisierungen drei verschiedenen Personen zeigen würden, würden sie wahrscheinlich mit drei leicht unterschiedlichen Eindrücken davon, was die Daten bedeuten, gehen. Das ist eines der Dinge, die ich an der Datenvisualisierung am faszinierendsten finde. Wir sprechen oft über Visualisierung, als wäre sie einfach der letzte Schritt in einer Datenanalyse-Pipeline, aber das ist überhaupt nicht genau! Visualisierung ist nicht nur ein Bild der Daten; sie ist eine Interpretationsschicht zwischen den Daten und der Person, die sie betrachtet. Das bedeutet, wenn wir ein Diagramm, eine Achse, eine Skala, eine Gruppierung oder sogar auswählen, was weggelassen wird, treffen wir Entscheidungen über die Geschichte, die der Leser sehen wird.

Jeder, der mit Daten arbeitet, weiß, dass der schwierige Teil selten darin besteht, nur ein Diagramm auf den Bildschirm zu bringen. Der schwierige Teil besteht darin, zu entscheiden, welches Diagramm wir zeigen. Sollten wir uns auf den Trend konzentrieren? Den Unterschied zwischen Gruppen? Die Variabilität? Die Ausreißer? Zwei Visualisierungen können völlig genau sein und dennoch den Betrachter zu sehr unterschiedlichen Schlussfolgerungen führen. Eine wichtige Frage hier ist: Welches Diagramm soll ich verwenden? Aber eine bessere Frage ist: Auf welchen Aspekt der Daten bitte ich den Leser zu achten?

Angenommen, ich möchte die Beziehung zwischen der Trainingsdauer einer Person und ihrer Stärke darstellen. Mit einem einfachen Liniendiagramm können Sie sehen, dass mit zunehmender Trainingszeit auch die Stärke zunimmt. Aber die Linie lässt die Beziehung kontinuierlich und fast linear erscheinen. Stattdessen betont eine stufenartige Darstellung, dass die Stärke tendenziell in Etappen zunimmt. Die Verwendung einer logarithmischen Skala für die Stärke kann große Verbesserungen am Anfang betonen, die als „Neulingsgewinne“ bekannt sind. Keine Skala ist von Natur aus wahrheitsgemäßer.

Wir können noch weiter gehen: Ein Boxplot könnte die Variabilität zwischen Trainingseinheiten betonen, ein Balkendiagramm könnte verschiedene Trainingsperioden vergleichen, und ein Streudiagramm könnte einzelne Beobachtungen zeigen. Die Zahlen haben sich nicht geändert; unsere Interpretation hat sich geändert, und auch die Botschaft, die wir übermitteln.

Wie können verschiedene Visualisierungen derselben Daten unterschiedliche Geschichten erzählen?

Indem Sie Diagrammtypen, Achsen, Skalen oder Gruppierungen ändern, betonen Sie verschiedene Aspekte der Daten, was Betrachter zu unterschiedlichen Interpretationen führt, auch wenn die zugrunde liegenden Zahlen unverändert bleiben.

Deutsch version →


🇪🇸 Español

¿Cuántas historias pueden contar tus datos?

Permíteme pintar una escena: obtienes un nuevo conjunto de datos y necesitas explorarlo, así que no cambias ni un solo número, pero haces tres visualizaciones diferentes. Si mostrara esas visualizaciones a tres personas diferentes, probablemente se irían con tres impresiones ligeramente diferentes de lo que significan los datos. Eso es una de las cosas que más me fascinan de la visualización de datos. A menudo hablamos de la visualización como si fuera simplemente el paso final en un pipeline de análisis de datos, ¡pero eso no es exacto en absoluto! La visualización no es solo una imagen de los datos; es una capa de interpretación entre los datos y la persona que los mira. Eso significa que cuando elegimos un gráfico, un eje, una escala, una agrupación, o incluso qué omitir, estamos tomando decisiones sobre la historia que el lector verá.

Cualquiera que trabaje con datos sabe que la parte difícil rara vez es solo poner un gráfico en la pantalla. La parte difícil es decidir qué gráfico mostramos. ¿Debemos centrarnos en la tendencia? ¿La diferencia entre grupos? ¿La variabilidad? ¿Los valores atípicos? Dos visualizaciones pueden ser completamente precisas y aún así llevar al espectador a conclusiones muy diferentes. Una pregunta importante aquí es: ¿Qué gráfico debo usar? Pero una mejor pregunta es: ¿Qué aspecto de los datos estoy pidiendo al lector que note?

Supongamos que quiero representar la relación entre cuánto tiempo alguien ha estado entrenando y su fuerza. Usando un gráfico de líneas simple, puedes ver que a medida que aumenta el tiempo de entrenamiento, la fuerza aumenta. Pero la línea hace que la relación parezca continua y casi lineal. En cambio, una representación escalonada enfatiza que la fuerza tiende a aumentar en etapas. Usar una escala logarítmica para la fuerza puede enfatizar grandes mejoras al principio, conocidas como "ganancias de novato". Ninguna escala es inherentemente más veraz.

Podemos ir aún más lejos: un diagrama de caja podría enfatizar la variabilidad entre sesiones de entrenamiento, un gráfico de barras podría comparar diferentes períodos de entrenamiento, y un diagrama de dispersión podría mostrar observaciones individuales. Los números no han cambiado; nuestra interpretación ha cambiado, y también el mensaje que estamos transmitiendo.

¿Cómo pueden diferentes visualizaciones de los mismos datos contar historias diferentes?

Al cambiar tipos de gráficos, ejes, escalas o agrupaciones, enfatizas diferentes aspectos de los datos, llevando a los espectadores a interpretaciones diferentes incluso cuando los números subyacentes permanecen sin cambios.

Español version →


🇫🇷 Français

Combien d'histoires vos données peuvent-elles raconter ?

Permettez-moi de brosser un tableau : vous obtenez un nouvel ensemble de données et devez l'explorer, donc vous ne changez pas un seul chiffre, mais vous créez trois visualisations différentes. Si vous montriez ces visualisations à trois personnes différentes, elles repartiraient probablement avec trois impressions légèrement différentes de ce que signifient les données. C'est l'une des choses que je trouve les plus fascinantes dans la visualisation de données. Nous parlons souvent de la visualisation comme si elle était simplement la dernière étape d'un pipeline d'analyse de données, mais ce n'est pas du tout exact ! La visualisation n'est pas seulement une image des données ; c'est une couche d'interprétation entre les données et la personne qui les regarde. Cela signifie que lorsque nous choisissons un graphique, un axe, une échelle, un regroupement, ou même ce que nous omettons, nous prenons des décisions sur l'histoire que le lecteur verra.

Quiconque travaille avec des données sait que la partie difficile est rarement de mettre un graphique à l'écran. La partie difficile est de décider quel graphique montrer. Devons-nous nous concentrer sur la tendance ? La différence entre les groupes ? La variabilité ? Les valeurs aberrantes ? Deux visualisations peuvent être complètement précises et pourtant mener le spectateur à des conclusions très différentes. Une question importante ici est : quel graphique dois-je utiliser ? Mais une meilleure question est : quel aspect des données est-ce que je demande au lecteur de remarquer ?

Supposons que je veuille représenter la relation entre la durée d'entraînement d'une personne et sa force. En utilisant un simple graphique linéaire, vous pouvez voir que plus le temps d'entraînement augmente, plus la force augmente. Mais la ligne rend la relation continue et presque linéaire. Au lieu de cela, une représentation en escalier souligne que la force tend à augmenter par étapes. Utiliser une échelle logarithmique pour la force peut souligner les grandes améliorations au début, connues sous le nom de "gains de débutant". Aucune échelle n'est intrinsèquement plus véridique.

Nous pouvons aller encore plus loin : un diagramme en boîte pourrait souligner la variabilité entre les séances d'entraînement, un diagramme à barres pourrait comparer différentes périodes d'entraînement, et un nuage de points pourrait montrer des observations individuelles. Les chiffres n'ont pas changé ; notre interprétation a changé, et le message que nous délivrons aussi.

Comment différentes visualisations des mêmes données peuvent-elles raconter des histoires différentes ?

En changeant les types de graphiques, les axes, les échelles ou les regroupements, vous mettez l'accent sur différents aspects des données, conduisant les spectateurs à des interprétations différentes même si les chiffres sous-jacents restent inchangés.

Français version →


🇮🇳 हिन्दी

आपका डेटा कितनी कहानियाँ बता सकता है?

मुझे एक दृश्य चित्रित करने दें: आपको एक नया डेटासेट मिलता है और उसे एक्सप्लोर करने की आवश्यकता होती है, इसलिए आप एक भी संख्या नहीं बदलते, लेकिन तीन अलग-अलग विज़ुअलाइज़ेशन बनाते हैं। यदि आप उन विज़ुअलाइज़ेशन को तीन अलग-अलग लोगों को दिखाते हैं, तो वे शायद डेटा के अर्थ के बारे में तीन थोड़ी अलग धारणाओं के साथ जाएंगे। यह उन चीजों में से एक है जो मुझे डेटा विज़ुअलाइज़ेशन के बारे में सबसे आकर्षक लगती है। हम अक्सर विज़ुअलाइज़ेशन के बारे में बात करते हैं जैसे कि यह डेटा-विश्लेषण पाइपलाइन में अंतिम चरण हो, लेकिन यह बिल्कुल सटीक नहीं है! विज़ुअलाइज़ेशन केवल डेटा की एक तस्वीर नहीं है; यह डेटा और उसे देखने वाले व्यक्ति के बीच एक व्याख्या परत है। इसका मतलब है कि जब हम एक चार्ट, एक अक्ष, एक स्केल, एक समूह, या यहां तक कि क्या छोड़ना है, चुनते हैं, तो हम उस कहानी के बारे में निर्णय ले रहे हैं जो पाठक देखेगा।

जो कोई भी डेटा के साथ काम करता है वह जानता है कि कठिन हिस्सा शायद ही कभी सिर्फ स्क्रीन पर ग्राफ लाना होता है। कठिन हिस्सा यह तय करना है कि हम कौन सा ग्राफ दिखाते हैं। क्या हमें प्रवृत्ति पर ध्यान केंद्रित करना चाहिए? समूहों के बीच अंतर? परिवर्तनशीलता? आउटलायर्स? दो विज़ुअलाइज़ेशन पूरी तरह से सटीक हो सकते हैं और फिर भी दर्शक को बहुत अलग निष्कर्षों तक ले जा सकते हैं। यहां एक महत्वपूर्ण प्रश्न है: मुझे कौन सा चार्ट उपयोग करना चाहिए? लेकिन एक बेहतर प्रश्न है: मैं पाठक से डेटा के किस पहलू पर ध्यान देने के लिए कह रहा हूं?

मान लीजिए मैं किसी के प्रशिक्षण के समय और उनकी ताकत के बीच संबंध दर्शाना चाहता हूं। एक सरल लाइन ग्राफ का उपयोग करके, आप देख सकते हैं कि जैसे-जैसे प्रशिक्षण समय बढ़ता है, ताकत बढ़ती है। लेकिन रेखा संबंध को निरंतर और लगभग रैखिक दिखाती है। इसके बजाय, एक चरण-जैसा प्रतिनिधित्व इस बात पर जोर देता है कि ताकत चरणों में बढ़ती है। ताकत के लिए लॉगरिदमिक स्केल का उपयोग शुरुआती बड़े सुधारों पर जोर दे सकता है, जिन्हें "न्यूबी गेन्स" के रूप में जाना जाता है। कोई भी स्केल स्वाभाविक रूप से अधिक सत्य नहीं है।

हम और भी आगे जा सकते हैं: एक बॉक्स प्लॉट प्रशिक्षण सत्रों के बीच परिवर्तनशीलता पर जोर दे सकता है, एक बार चार्ट विभिन्न प्रशिक्षण अवधियों की तुलना कर सकता है, और एक स्कैटर प्लॉट व्यक्तिगत अवलोकन दिखा सकता है। संख्याएं नहीं बदली हैं; हमारी व्याख्या बदल गई है, और हमारा संदेश भी।

समान डेटा के विभिन्न विज़ुअलाइज़ेशन अलग-अलग कहानियाँ कैसे बता सकते हैं?

चार्ट प्रकार, अक्ष, स्केल या समूह बदलकर, आप डेटा के विभिन्न पहलुओं पर जोर देते हैं, जिससे दर्शक अलग-अलग व्याख्याएं करते हैं, भले ही अंतर्निहित संख्याएं अपरिवर्तित रहें।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Berapa Banyak Cerita yang Dapat Diceritakan oleh Data Anda?

Izinkan saya melukiskan sebuah adegan: Anda mendapatkan dataset baru dan perlu mengeksplorasinya, jadi Anda tidak mengubah satu angka pun, tetapi membuat tiga visualisasi berbeda. Jika Anda menunjukkan visualisasi tersebut kepada tiga orang yang berbeda, mereka mungkin akan pergi dengan tiga kesan yang sedikit berbeda tentang apa arti data tersebut. Itu adalah salah satu hal yang paling saya kagumi tentang visualisasi data. Kita sering berbicara tentang visualisasi seolah-olah itu hanya langkah terakhir dalam pipeline analisis data, tetapi itu tidak akurat sama sekali! Visualisasi bukan hanya gambar data; itu adalah lapisan interpretasi antara data dan orang yang melihatnya. Itu berarti ketika kita memilih bagan, sumbu, skala, pengelompokan, atau bahkan apa yang harus dikecualikan, kita membuat keputusan tentang cerita yang akan dilihat pembaca.

Siapa pun yang bekerja dengan data tahu bahwa bagian sulit jarang hanya menampilkan grafik di layar. Bagian sulitnya adalah memutuskan grafik mana yang akan ditampilkan. Haruskah kita fokus pada tren? Perbedaan antar kelompok? Variabilitas? Pencilan? Dua visualisasi bisa sepenuhnya akurat dan tetap membawa pemirsa ke kesimpulan yang sangat berbeda. Satu pertanyaan penting di sini adalah: Bagan mana yang harus saya gunakan? Tetapi pertanyaan yang lebih baik adalah: Aspek data apa yang saya minta pembaca untuk perhatikan?

Misalkan saya ingin mewakili hubungan antara berapa lama seseorang telah berlatih dan kekuatan mereka. Menggunakan grafik garis sederhana, Anda dapat melihat bahwa seiring bertambahnya waktu latihan, kekuatan juga meningkat. Tetapi garis membuat hubungan terlihat kontinu dan hampir linier. Sebaliknya, representasi seperti langkah menekankan bahwa kekuatan cenderung meningkat secara bertahap. Menggunakan skala logaritmik untuk kekuatan dapat menekankan peningkatan besar di awal, yang dikenal sebagai "newbie gains". Tidak ada skala yang secara inheren lebih jujur.

Kita bisa melangkah lebih jauh: plot kotak bisa menekankan variabilitas antar sesi latihan, bagan batang bisa membandingkan periode latihan yang berbeda, dan plot sebar bisa menunjukkan pengamatan individu. Angka-angka tidak berubah; interpretasi kita berubah, dan begitu juga pesan yang kita sampaikan.

Bagaimana visualisasi yang berbeda dari data yang sama dapat menceritakan kisah yang berbeda?

Dengan mengubah jenis bagan, sumbu, skala, atau pengelompokan, Anda menekankan aspek data yang berbeda, yang mengarahkan pemirsa ke interpretasi yang berbeda meskipun angka yang mendasarinya tetap tidak berubah.

Bahasa Indonesia version →


🇯🇵 日本語

あなたのデータはいくつのストーリーを語れるか?

シーンを描かせてください:新しいデータセットを入手し、それを探索する必要があるとします。あなたは数字を一つも変えずに、3つの異なる可視化を作成します。それらの可視化を3人の異なる人に見せた場合、彼らはデータが何を意味するかについて、それぞれ少し異なる印象を持って去るでしょう。これは私がデータ可視化について最も魅力的だと感じることの一つです。私たちはしばしば可視化を、データ分析パイプラインの単なる最終ステップであるかのように話しますが、それはまったく正確ではありません!可視化は単にデータの絵ではなく、データとそれを見る人との間の解釈層です。つまり、チャート、軸、スケール、グループ化、または何を省略するかを選ぶとき、私たちは読者が見るストーリーについて決定を下しているのです。

データを扱う人なら誰でも、難しい部分がめったにグラフを画面に表示することだけではないことを知っています。難しい部分は、どのグラフを表示するかを決めることです。トレンドに焦点を当てるべきでしょうか?グループ間の違い?変動性?外れ値?2つの可視化は完全に正確でありながら、視聴者を非常に異なる結論に導くことができます。ここで重要な質問は:どのチャートを使うべきか?しかし、より良い質問は:データのどの側面を読者に気づかせようとしているのか?

誰かがトレーニングしてきた期間とその強さの関係を表現したいとします。単純な折れ線グラフを使用すると、トレーニング時間が増えるにつれて強さも増加することがわかります。しかし、線は関係を連続的でほぼ線形に見せます。代わりに、階段状の表現は、強さが段階的に増加する傾向があることを強調します。強さに対数スケールを使用すると、初期の大きな改善、いわゆる「初心者ゲイン」を強調できます。どちらのスケールも本質的により真実というわけではありません。

さらに進むこともできます:箱ひげ図はトレーニングセッション間の変動性を強調でき、棒グラフは異なるトレーニング期間を比較でき、散布図は個々の観測値を示すことができます。数字は変わっていません;私たちの解釈が変わり、伝えるメッセージも変わりました。

同じデータの異なる可視化はどのように異なるストーリーを語ることができますか?

チャートの種類、軸、スケール、またはグループ化を変更することで、データの異なる側面を強調し、基礎となる数字が変わらなくても視聴者を異なる解釈に導きます。

日本語 version →


🇧🇷 Português

Quantas histórias seus dados podem contar?

Permita-me pintar uma cena: você obtém um novo conjunto de dados e precisa explorá-lo, então não altera um único número, mas faz três visualizações diferentes. Se você mostrasse essas visualizações a três pessoas diferentes, elas provavelmente sairiam com três impressões ligeiramente diferentes do que os dados significam. Essa é uma das coisas que mais me fascinam na visualização de dados. Frequentemente falamos sobre visualização como se fosse simplesmente a etapa final em um pipeline de análise de dados, mas isso não é preciso de forma alguma! A visualização não é apenas uma imagem dos dados; é uma camada de interpretação entre os dados e a pessoa que os observa. Isso significa que quando escolhemos um gráfico, um eixo, uma escala, um agrupamento, ou até mesmo o que omitir, estamos tomando decisões sobre a história que o leitor verá.

Qualquer pessoa que trabalha com dados sabe que a parte difícil raramente é apenas colocar um gráfico na tela. A parte difícil é decidir qual gráfico mostrar. Devemos focar na tendência? A diferença entre grupos? A variabilidade? Os outliers? Duas visualizações podem ser completamente precisas e ainda assim levar o espectador a conclusões muito diferentes. Uma pergunta importante aqui é: qual gráfico devo usar? Mas uma pergunta melhor é: que aspecto dos dados estou pedindo ao leitor para notar?

Suponha que eu queira representar a relação entre quanto tempo alguém tem treinado e sua força. Usando um gráfico de linhas simples, você pode ver que à medida que o tempo de treinamento aumenta, a força aumenta. Mas a linha faz a relação parecer contínua e quase linear. Em vez disso, uma representação em etapas enfatiza que a força tende a aumentar em estágios. Usar uma escala logarítmica para a força pode enfatizar grandes melhorias no início, conhecidas como "ganhos de novato". Nenhuma escala é inerentemente mais verdadeira.

Podemos ir ainda mais longe: um gráfico de caixa poderia enfatizar a variabilidade entre sessões de treinamento, um gráfico de barras poderia comparar diferentes períodos de treinamento, e um gráfico de dispersão poderia mostrar observações individuais. Os números não mudaram; nossa interpretação mudou, e também a mensagem que estamos transmitindo.

Como diferentes visualizações dos mesmos dados podem contar histórias diferentes?

Ao alterar tipos de gráficos, eixos, escalas ou agrupamentos, você enfatiza diferentes aspectos dos dados, levando os espectadores a interpretações diferentes, mesmo que os números subjacentes permaneçam inalterados.

Português version →


🇷🇺 Русский

Сколько историй могут рассказать ваши данные?

Позвольте мне нарисовать сцену: вы получаете новый набор данных и вам нужно его исследовать, поэтому вы не меняете ни одного числа, но создаете три разные визуализации. Если бы вы показали эти визуализации трем разным людям, они, скорее всего, ушли бы с тремя немного разными впечатлениями о том, что означают данные. Это одна из вещей, которые я нахожу наиболее увлекательными в визуализации данных. Мы часто говорим о визуализации так, как будто это просто последний шаг в конвейере анализа данных, но это совсем не точно! Визуализация — это не просто картинка данных; это слой интерпретации между данными и человеком, который на них смотрит. Это означает, что когда мы выбираем график, ось, шкалу, группировку или даже то, что опустить, мы принимаем решения о истории, которую увидит читатель.

Любой, кто работает с данными, знает, что сложная часть редко заключается в том, чтобы просто вывести график на экран. Сложная часть — решить, какой график показать. Следует ли нам сосредоточиться на тренде? Разнице между группами? Изменчивости? Выбросах? Две визуализации могут быть полностью точными и все же привести зрителя к очень разным выводам. Один важный вопрос здесь: какой график мне использовать? Но лучший вопрос: на какой аспект данных я прошу читателя обратить внимание?

Предположим, я хочу представить взаимосвязь между тем, как долго кто-то тренируется, и его силой. Используя простой линейный график, вы можете увидеть, что с увеличением времени тренировок сила увеличивается. Но линия делает взаимосвязь непрерывной и почти линейной. Вместо этого ступенчатое представление подчеркивает, что сила имеет тенденцию увеличиваться этапами. Использование логарифмической шкалы для силы может подчеркнуть большие улучшения в начале, известные как «прибавки новичка». Ни одна шкала не является по своей сути более правдивой.

Мы можем пойти еще дальше: ящичковая диаграмма может подчеркнуть изменчивость между тренировочными сессиями, столбчатая диаграмма может сравнивать разные периоды тренировок, а точечная диаграмма может показать отдельные наблюдения. Числа не изменились; изменилась наша интерпретация, и изменилось сообщение, которое мы передаем.

Как разные визуализации одних и тех же данных могут рассказывать разные истории?

Изменяя типы графиков, оси, шкалы или группировки, вы подчеркиваете разные аспекты данных, что приводит зрителей к разным интерпретациям, даже если основные числа остаются неизменными.

Русский version →


🇨🇳 简体中文

你的数据能讲述多少个故事?

让我描绘一个场景:你获得了一个新数据集并需要探索它,所以你没有改变任何一个数字,但制作了三种不同的可视化。如果你把这些可视化展示给三个人,他们很可能会对数据的含义产生三种略有不同的印象。这是我觉得数据可视化最迷人的地方之一。我们经常把可视化当作数据分析流程的最后一步来谈论,但这完全不对!可视化不仅仅是数据的一幅图画;它是数据与观察者之间的解释层。这意味着当我们选择图表、坐标轴、比例、分组,甚至选择省略什么时,我们都在决定读者将看到的故事。

任何处理数据的人都知道,困难的部分很少只是把图表放到屏幕上。困难的部分是决定显示哪个图表。我们应该关注趋势吗?组间的差异?变异性?异常值?两种可视化可以完全准确,但仍然引导观众得出非常不同的结论。这里一个重要的问题是:我应该使用哪个图表?但更好的问题是:我想让读者注意到数据的哪个方面?

假设我想表示一个人训练时间与其力量之间的关系。使用简单的折线图,你可以看到随着训练时间的增加,力量也在增加。但这条线使关系看起来连续且几乎线性。相反,阶梯式表示强调力量倾向于分阶段增加。对力量使用对数刻度可以强调早期的巨大进步,即所谓的“新手增益”。没有哪种刻度本质上更真实。

我们甚至可以更进一步:箱线图可以强调训练会话之间的变异性,条形图可以比较不同的训练时期,散点图可以显示个体观察。数字没有改变;我们的解释改变了,我们传递的信息也改变了。

相同数据的不同可视化如何讲述不同的故事?

通过改变图表类型、坐标轴、比例或分组,你强调数据的不同方面,导致观众产生不同的解释,即使底层数字保持不变。

简体中文 version →