Lassen Sie mich eine Szene malen: Sie erhalten einen neuen Datensatz und müssen ihn erkunden, also ändern Sie keine einzige Zahl, aber erstellen drei verschiedene Visualisierungen. Wenn Sie diese Visualisierungen drei verschiedenen Personen zeigen würden, würden sie wahrscheinlich mit drei leicht unterschiedlichen Eindrücken davon, was die Daten bedeuten, gehen. Das ist eines der Dinge, die ich an der Datenvisualisierung am faszinierendsten finde. Wir sprechen oft über Visualisierung, als wäre sie einfach der letzte Schritt in einer Datenanalyse-Pipeline, aber das ist überhaupt nicht genau! Visualisierung ist nicht nur ein Bild der Daten; sie ist eine Interpretationsschicht zwischen den Daten und der Person, die sie betrachtet. Das bedeutet, wenn wir ein Diagramm, eine Achse, eine Skala, eine Gruppierung oder sogar auswählen, was weggelassen wird, treffen wir Entscheidungen über die Geschichte, die der Leser sehen wird.
Jeder, der mit Daten arbeitet, weiß, dass der schwierige Teil selten darin besteht, nur ein Diagramm auf den Bildschirm zu bringen. Der schwierige Teil besteht darin, zu entscheiden, welches Diagramm wir zeigen. Sollten wir uns auf den Trend konzentrieren? Den Unterschied zwischen Gruppen? Die Variabilität? Die Ausreißer? Zwei Visualisierungen können völlig genau sein und dennoch den Betrachter zu sehr unterschiedlichen Schlussfolgerungen führen. Eine wichtige Frage hier ist: Welches Diagramm soll ich verwenden? Aber eine bessere Frage ist: Auf welchen Aspekt der Daten bitte ich den Leser zu achten?
Angenommen, ich möchte die Beziehung zwischen der Trainingsdauer einer Person und ihrer Stärke darstellen. Mit einem einfachen Liniendiagramm können Sie sehen, dass mit zunehmender Trainingszeit auch die Stärke zunimmt. Aber die Linie lässt die Beziehung kontinuierlich und fast linear erscheinen. Stattdessen betont eine stufenartige Darstellung, dass die Stärke tendenziell in Etappen zunimmt. Die Verwendung einer logarithmischen Skala für die Stärke kann große Verbesserungen am Anfang betonen, die als „Neulingsgewinne“ bekannt sind. Keine Skala ist von Natur aus wahrheitsgemäßer.
Wir können noch weiter gehen: Ein Boxplot könnte die Variabilität zwischen Trainingseinheiten betonen, ein Balkendiagramm könnte verschiedene Trainingsperioden vergleichen, und ein Streudiagramm könnte einzelne Beobachtungen zeigen. Die Zahlen haben sich nicht geändert; unsere Interpretation hat sich geändert, und auch die Botschaft, die wir übermitteln.