Mathematik lernen · Klasse 5–Oberstufe

Statistik

Von der Umfrage bis zur Glockenkurve: Du lernst Daten zu sammeln, zu zeichnen und zu deuten, rechnest Mittelwert und Standardabweichung und erkennst, wie Statistiken täuschen können.

Die Statistik sammelt, ordnet, zeigt und deutet Daten. Sie beantwortet Fragen wie: Wie lange brauchen Kinder im Schnitt zur Schule? Wie stark schwankt die Körpergröße in einer Klasse? Stimmt eine Schlagzeile, in der „Studien zeigen“ vorkommt? Statistik begegnet dir in Umfragen, Wahlprognosen, Wetterberichten und beim Vergleich von Noten. Wer sie versteht, lässt sich nicht so leicht täuschen.

Das Wort kommt vom lateinischen status („Zustand“, „Staat“), denn Herrscher zählten schon früh ihr Volk, ihre Heere und ihre Steuern. Die Statistik mit Mittelwerten, Streuung und Glockenkurve entstand aber erst im 17. bis 19. Jahrhundert. Hier gehst du den Weg von der Umfrage bis zur Normalverteilung, rechnest Beispiele durch und lernst, wie Diagramme in die Irre führen.

Daten erheben: Stichprobe und Merkmale

Am Anfang steht eine Frage, etwa: Wie kommen die Kinder deiner Klasse zur Schule? Die Gruppe, über die du etwas wissen willst, heißt Grundgesamtheit. Meist kannst du nicht alle befragen, sondern nur einen Teil, die Stichprobe. Sie muss repräsentativ sein, also die Grundgesamtheit gut abbilden. Das gelingt am besten, wenn der Zufall entscheidet, wer befragt wird.

Die Eigenschaft, die du erfasst, heißt Merkmal, ihre möglichen Werte heißen Ausprägungen. Ein Merkmal ist qualitativ, wenn es Kategorien beschreibt (Verkehrsmittel, Lieblingsfach), und quantitativ, wenn es Zahlen liefert. Bei Zahlen unterscheidest du diskrete Werte, die du zählst (Geschwisterzahl), und stetige Werte, die du misst (Körpergröße, Zeit). Die ungeordnete Liste aller Antworten heißt Urliste.

Absolute und relative Häufigkeit

Zuerst zählst du aus. Die absolute Häufigkeit sagt, wie oft eine Ausprägung vorkommt. Teilst du sie durch die Gesamtzahl n der Befragten, erhältst du die relative Häufigkeit, also den Anteil. Du kannst ihn als Bruch, Dezimalzahl oder in Prozent schreiben (mehr dazu in der Prozentrechnung).

Häufigkeitstabelle zum Schulweg von 25 Kindern
Verkehrsmittelabsolutrelativin Prozent
Zu Fuß77/25 = 0,2828 %
Fahrrad66/25 = 0,2424 %
Bus88/25 = 0,3232 %
Auto44/25 = 0,1616 %
Summe251100 %

Diagramme: Säulen und Kreis

Ein Bild sagt oft mehr als eine Tabelle. Welches Diagramm passt, hängt von der Frage ab. Für zeitliche Verläufe nimmst du ein Liniendiagramm, für stetige Werte in Klassen ein Histogramm. Für Kategorien kommen vor allem zwei Typen infrage.

Das Säulendiagramm

Für jede Ausprägung zeichnest du eine Säule, deren Höhe die Häufigkeit zeigt. Die Säulen stehen gleich breit und mit gleichem Abstand auf einer Achse, die bei 0 beginnt. So vergleichst du Größen auf einen Blick.

2 4 6 8 10 0 7 Zu Fuß 6 Fahrrad 8 Bus 4 Auto Anzahl der Kinder
Säulendiagramm zum Schulweg von 25 Kindern. Die hervorgehobene Säule ist die höchste: Der Bus ist das häufigste Verkehrsmittel.

Das Kreisdiagramm

Das Kreisdiagramm zeigt, wie sich ein Ganzes in Anteile aufteilt. Jede Ausprägung bekommt einen Kreisausschnitt, dessen Winkel zum Anteil passt: Winkel =h·360°. Für die Fußgänger ist das 0,28·360°=100,8°. Alle vier Winkel ergeben 100,8°+86,4°+115,2°+57,6°=360°. Kreisdiagramme eignen sich für wenige Anteile, bis etwa fünf. Für viele Kategorien sind Säulen besser lesbar. Mehr zu Winkeln und Kreisen findest du in der Geometrie.

Zu Fuß: 28 % Fahrrad: 24 % Bus: 32 % Auto: 16 %
Kreisdiagramm zum Schulweg von 25 Kindern mit den Anteilen 28, 24, 32 und 16 Prozent.

Mittelwert, Median und Modus

Oft willst du eine ganze Datenreihe mit einer Zahl beschreiben. Dafür gibt es drei „Mitten“. Als Beispiel dienen die Schulwegzeiten von 11 Kindern in Minuten, der Größe nach geordnet: 5, 7, 8, 10, 10, 12, 15, 18, 20, 25, 40.

  • Der Mittelwert (Durchschnitt) ist die Summe aller Werte geteilt durch ihre Anzahl: 17011≈15,5 Minuten.
  • Der Median ist der mittlere Wert der geordneten Liste. Bei 11 Werten ist es der sechste: 12 Minuten. Bei einer geraden Anzahl nimmst du den Mittelwert der beiden mittleren Werte.
  • Der Modus ist der häufigste Wert: 10 Minuten. Er funktioniert auch bei Kategorien. Beim Schulweg oben ist „Bus“ der Modus.

Spannweite, Quartile und Boxplot

Zwei Klassen können denselben Mittelwert haben und doch ganz verschieden aussehen. Die Streuung beschreibt, wie weit die Werte auseinanderliegen. Das einfachste Maß ist die Spannweite: größter minus kleinster Wert. Bei den Schulwegen sind es 40−5=35 Minuten. Sie reagiert allerdings stark auf einzelne Extremwerte.

Robuster sind die Quartile. Der Median teilt die geordneten Daten in eine untere und eine obere Hälfte. Der Median der unteren Hälfte ist das untere Quartil Q1, der Median der oberen Hälfte das obere Quartil Q3. Dazwischen liegen die mittleren 50 % der Daten, ihr Abstand Q3−Q1 heißt Interquartilsabstand. Bei den Schulwegen ergibt die untere Hälfte (5, 7, 8, 10, 10) das Quartil Q1=8 und die obere Hälfte (15, 18, 20, 25, 40) das Quartil Q3=20. Der Abstand beträgt 12. Der Median selbst gehört bei ungerader Anzahl zu keiner Hälfte. Taschenrechner und Tabellenprogramme nutzen teils andere Verfahren und liefern leicht abweichende Quartile.

Ein Boxplot zeigt fünf Werte auf einen Blick. Die Box reicht von Q1 bis Q3, ein Strich markiert den Median. Die „Whisker“ (Schnurrhaare) reichen bis zum kleinsten und größten Wert, die noch höchstens das 1,5-Fache des Interquartilsabstands von der Box entfernt liegen. Weiter entfernte Werte sind Ausreißer und werden als Punkte gezeichnet. Hier liegt die Grenze bei 20+1,5·12=38. Also ist die 40 ein Ausreißer, und der obere Whisker endet bei 25.

0 5 10 15 20 25 30 35 40 45 Schulweg in Minuten Median 12 Min. 5 Max. 25 Ausreißer 40 Q1 = 8 Q3 = 20
Boxplot der Schulwegzeiten von 11 Kindern: Die Box zeigt die mittleren 50 Prozent, der dicke Strich den Median, der einzelne Punkt den Ausreißer.

Varianz und Standardabweichung

Die wichtigste Kennzahl der Streuung fragt: Wie weit liegen die Werte im Durchschnitt vom Mittelwert entfernt? Die Abweichungen einfach zu mitteln, funktioniert nicht, denn positive und negative heben sich genau auf. Deshalb quadriert man sie zuerst. Der Mittelwert dieser Quadrate heißt Varianz s2. Ihre Wurzel ist die Standardabweichung s. Sie hat dieselbe Einheit wie die Daten und ist daher anschaulicher.

Ein Rechenbeispiel: Acht Kinder erreichen in einem Quiz die Punktzahlen 2, 4, 4, 4, 5, 5, 7 und 9. Der Mittelwert ist 408=5.

Rechenschema für Varianz und Standardabweichung
Punktzahl xAbweichung x − 5Quadrat (x − 5)²
2−39
4−11
4−11
4−11
500
500
724
9416
Summe032

Die Summe der Abweichungen ist immer 0, ein guter Kontrollwert für deine Rechnung. Hast du nur eine Stichprobe und willst auf die Grundgesamtheit schließen, teilt man in der Oberstufe und im Studium durch n−1 statt durch n. Hier wären das 327≈4,57 und s≈2,14. Bei großen Datenmengen ist der Unterschied klein.

Die Normalverteilung und die 68-95-99,7-Regel

Misst du die Körpergröße vieler Erwachsener, die Füllmenge von Milchtüten oder die Fehler einer Messung, entsteht oft dasselbe Bild: Die meisten Werte liegen nahe beim Mittelwert, nach außen werden sie links und rechts gleichmäßig seltener. Das Histogramm sieht aus wie eine Glocke. Die zugehörige Kurve heißt Normalverteilung oder gaußsche Glockenkurve. Zwei Zahlen legen sie fest: der Mittelwert μ („mü“) bestimmt die Lage der Mitte, die Standardabweichung σ („sigma“) die Breite.

μ−3σ μ−2σ μ−σ μ μ+σ μ+2σ μ+3σ 68 % 95 % 99,7 %
Die Glockenkurve der Normalverteilung. Je dunkler die Fläche, desto mehr Werte liegen dort: 68 Prozent innerhalb einer, 95 Prozent innerhalb von zwei und 99,7 Prozent innerhalb von drei Standardabweichungen um den Mittelwert.

Korrelation ist nicht Kausalität

Trägst du zwei Merkmale gegeneinander auf, etwa Körpergröße und Schuhgröße, kann ein Zusammenhang sichtbar werden. Man nennt ihn Korrelation. Ein Maß dafür ist der Korrelationskoeffizient r mit −1≤r≤1. Bei r nahe 1 wachsen beide Größen gemeinsam, bei r nahe −1 fällt die eine, wenn die andere steigt, und bei r nahe 0 gibt es keinen linearen Zusammenhang. Die Gerade, die am besten durch die Punktwolke passt, heißt Regressionsgerade.

Eine Korrelation beweist aber keine Ursache. Im Sommer steigt der Eisverkauf, und es ertrinken mehr Menschen in Badeseen. Das Eis verursacht keine Unfälle, beides hängt vom heißen Wetter ab. Solche versteckten dritten Faktoren heißen Störgrößen. Ein Klassiker ist der Storch: Der Statistiker Robert Matthews zeigte 2000 halb im Scherz, dass in europäischen Ländern die Zahl der Storchenpaare mit den Geburten korreliert. Der Grund: Größere Länder haben mehr Störche und mehr Menschen.

Lügen mit Statistik: abgeschnittene Achse und andere Tricks

Zahlen wirken objektiv, lassen sich aber so zeigen, dass ein falscher Eindruck entsteht. Der häufigste Trick ist die abgeschnittene Achse: Die Säulen beginnen nicht bei 0, sondern etwa bei 90 %. Dann sehen kleine Unterschiede riesig aus. Die Abbildung zeigt zweimal dieselben Daten.

Achse ab 0 % 0 % 100 % 92 % 2024 95 % 2025 Achse ab 90 % 90 % 100 % 92 % 2024 95 % 2025
Zweimal dieselben Zahlen: Links beginnt die Achse bei 0 Prozent, rechts bei 90 Prozent. Rechts wirkt die zweite Säule mehr als doppelt so hoch, obwohl sich der Wert nur um 3 Prozentpunkte unterscheidet.

Weitere Tricks begegnen dir ständig:

  • Verzerrte Stichprobe: 1936 sagte die US-Zeitschrift Literary Digest nach mehr als zwei Millionen Antworten einen Wahlsieg von Alf Landon voraus. Es gewann Franklin D. Roosevelt deutlich. Befragt hatte man vor allem wohlhabende Leute aus Telefon- und Autoregistern.
  • Relative statt absolute Zahlen: „Das Risiko verdoppelt sich!“ klingt dramatisch. Steigt es aber von 1 auf 2 Fälle pro 10.000 Menschen, wächst es nur um 0,01 Prozentpunkte.
  • Der passende Mittelwert: Je nach Absicht nennt man Mittelwert oder Median, siehe das Gehaltsbeispiel oben.
  • Ausgesuchte Zeiträume: Beginnt eine Kurve an einem Tiefpunkt, wirkt jeder Anstieg beeindruckend.

Geschichte: von der Volkszählung zur Glockenkurve

Zählungen sind alt: Schon das Römische Reich führte regelmäßige Volkszählungen durch. Als Wissenschaft begann die Statistik im 17. Jahrhundert. Der Londoner Kaufmann John Graunt wertete 1662 die Sterbelisten seiner Stadt aus und erkannte Regelmäßigkeiten in Geburten und Todesfällen. Gegen Ende des 19. Jahrhunderts entwickelten Francis Galton und Karl Pearson Regression und Korrelationskoeffizient.

Quetelet: der „mittlere Mensch“

Der belgische Astronom Adolphe Quetelet (1796–1874) übertrug die Methoden der Sternkunde auf die Gesellschaft. Er sammelte Körpergrößen und Brustumfänge und fand, dass sie um einen Mittelwert herum glockenförmig streuen. Sein Bild vom „mittleren Menschen“ (l’homme moyen) prägte die Sozialwissenschaften. Nach ihm ist der Quetelet-Index benannt: Körpergewicht geteilt durch das Quadrat der Körpergröße, heute als BMI bekannt.

Gauß und Legendre: die Methode der kleinsten Quadrate

Misst man öfter, als man für die Rechnung braucht, widersprechen sich die Messwerte leicht. Welche Gerade oder Kurve passt dann am besten? Die Methode der kleinsten Quadrate wählt die Kurve, bei der die Summe der quadrierten Abstände zu den Messpunkten am kleinsten ist. Adrien-Marie Legendre veröffentlichte sie 1805 im Anhang einer Arbeit über Kometenbahnen. Carl Friedrich Gauß erklärte, er nutze sie schon seit 1795, und druckte sie 1809. Der Prioritätsstreit ließ sich nie ganz klären. Berühmt wurde Gauß’ Bahnberechnung des Zwergplaneten Ceres: Er war 1801 entdeckt worden und nach wenigen Wochen am Himmel verloren gegangen. Mit Gauß’ Vorhersage fand man ihn wieder.

Dabei fragte sich Gauß auch, wie Messfehler verteilt sind, und kam auf die Glockenkurve. Entdeckt hatte sie schon 1733 Abraham de Moivre als Näherung der Binomialverteilung (siehe Wahrscheinlichkeitsrechnung). Laplace zeigte um 1810, warum sie so oft auftaucht: Addieren sich viele kleine, unabhängige Einflüsse, ist das Ergebnis ungefähr normalverteilt. Das ist der zentrale Grenzwertsatz.

Florence Nightingale: das Polardiagramm

Florence Nightingale (1820–1910) kennt man als Krankenschwester im Krimkrieg (1853–1856). Sie war aber auch eine hervorragende Statistikerin. Sie wertete die Todeszahlen der britischen Armee aus und fand: Weit mehr Soldaten starben an Seuchen als an Verwundungen, und die Ursache lag in mangelnder Hygiene der Lazarette. Damit Politiker diese Zahlen begreifen, zeichnete sie ein Polardiagramm. Ein Kreis ist in zwölf Keile geteilt, einer je Monat, und die Fläche jedes Keils zeigt die Zahl der Toten, getrennt nach Ursachen. Das Bild überzeugte und half, die Hygiene in den Militärkrankenhäusern zu verbessern. 1858 wurde sie als erste Frau in die Royal Statistical Society gewählt.

Quellen und weiterführende Literatur

  • Stephen M. Stigler: The History of Statistics. The Measurement of Uncertainty before 1900, Harvard University Press, Cambridge (Massachusetts) 1986.
  • Darrell Huff: How to Lie with Statistics, W. W. Norton, New York 1954.
  • Gerd Gigerenzer: Das Einmaleins der Skepsis. Über den richtigen Umgang mit Zahlen und Risiken, Berlin Verlag, Berlin 2002.
  • Carl Friedrich Gauß: Theoria motus corporum coelestium in sectionibus conicis solem ambientium, Hamburg 1809.
  • MacTutor History of Mathematics: Florence Nightingale (englisch)
  • Wikipedia: Statistik