Daten erheben — die Grundbegriffe
Jede statistische Untersuchung beginnt mit drei Festlegungen. Sie klingen selbstverständlich, entscheiden aber darüber, was die späteren Zahlen überhaupt bedeuten.
Grundgesamtheit
Die Menge aller Objekte, über die eine Aussage gemacht werden soll — zum Beispiel alle 1240 Personen einer Schule. Sie muss vor der Erhebung klar abgegrenzt sein.
Stichprobe
Der tatsächlich untersuchte Teil der Grundgesamtheit. Ihre Größe heißt Stichprobenumfang \(n\). Aus ihr wird auf die Grundgesamtheit geschlossen.
Merkmal
Die Eigenschaft, die an jedem Element erhoben wird (Körpergröße, Note, Verkehrsmittel). Die einzelnen möglichen Antworten heißen Merkmalswerte oder Ausprägungen.
Absolute und relative Häufigkeit
| Darstellung | wofür geeignet | Besonderheit |
|---|---|---|
| Säulendiagramm | wenige, klar getrennte Merkmalswerte | Säulen stehen mit Abstand nebeneinander |
| Kreisdiagramm | Anteile an einem Ganzen | Sektorwinkel \(\alpha = h(x)\cdot 360^{\circ}\) |
| Histogramm | klassierte Messwerte | Balken grenzen lückenlos aneinander |
| Boxplot | Vergleich mehrerer Verteilungen | zeigt fünf Punkte, keine Anzahlen |
Lagemaße — wo liegen die Daten?
Ein Lagemaß fasst eine ganze Datenreihe zu einer einzigen Zahl zusammen, die für ihre Position steht. Drei Lagemaße kommen im Kapitel vor; sie beantworten dieselbe Frage auf unterschiedliche Weise.
Median \(x_{\mathrm{Med}}\)
Der Wert in der Mitte der Rangliste. Zuerst sortieren, dann:
- \(n\) ungerade: der mittlere Wert, also \(x_{(n+1)/2}\)
- \(n\) gerade: das Mittel der beiden mittleren Werte
Mindestens 50 % der Werte sind kleiner oder gleich, mindestens 50 % größer oder gleich dem Median.
Modalwert \(x_{\mathrm{Mod}}\)
Der am häufigsten vorkommende Merkmalswert. Er ist immer selbst ein Messwert, kann aber mehrfach vorkommen (zwei Gipfel) oder wenig aussagekräftig sein, wenn alle Werte etwa gleich oft auftreten. Als einziges Lagemaß funktioniert er auch bei nicht-numerischen Merkmalen.
Spannweite \(S_w\)
\(S_w = x_{\max} - x_{\min}\). Streng genommen kein Lagemaß, sondern das einfachste Streumaß. Sie benutzt nur die beiden Randwerte und wird deshalb von einem einzigen Ausreißer vollständig bestimmt.
Klassierte Messwerte
Bei vielen verschiedenen Messwerten wird jede Einzelauflistung unübersichtlich. Man fasst dann benachbarte Werte zu Klassen zusammen. Das schafft Übersicht und kostet Genauigkeit — dieser Tausch ist der Kern des Abschnitts.
Regeln für die Klassenbildung
- alle Klassen gleich breit
- lückenlos und überschneidungsfrei — jeder Wert gehört zu genau einer Klasse
- Klassenzahl \(k \approx \sqrt{n}\), üblich sind 5 bis 20
- Klassenbreite \(b \ge \dfrac{S_w}{k}\), aufgerundet auf einen glatten Wert
Klassenmitte
\(m = \dfrac{\text{untere Grenze} + \text{obere Grenze}}{2}\)
Nach dem Klassieren sind die Einzelwerte verloren. Man rechnet so, als läge jeder Wert genau in der Mitte seiner Klasse.
Streumaße — wie weit liegen die Daten auseinander?
Zwei Datenreihen können denselben Mittelwert haben und trotzdem völlig verschieden aussehen. Erst ein Streumaß macht diesen Unterschied messbar. Die Spannweite reicht dafür nicht, weil sie nur zwei Werte kennt — gebraucht wird ein Maß, in das alle Werte eingehen.
Rechenweg in fünf Schritten
| Schritt | was zu tun ist | Kontrolle |
|---|---|---|
| 1 | \(\bar x\) berechnen | liegt zwischen kleinstem und größtem Wert |
| 2 | alle Abweichungen \(x_i - \bar x\) bilden | ihre Summe muss 0 ergeben |
| 3 | jede Abweichung quadrieren | alle Ergebnisse sind \(\ge 0\) |
| 4 | Quadrate addieren und durch \(n\) teilen \(\to s^2\) | Einheit ist quadriert |
| 5 | Wurzel ziehen \(\to s\) | \(s\) ist kleiner als die Spannweite |
Quartile und Boxplots
Der Boxplot fasst eine Verteilung zu fünf Zahlen zusammen und macht sie damit vergleichbar. Er gehört zum Median, so wie die Standardabweichung zum arithmetischen Mittel gehört.
Die fünf Punkte
- \(x_{\min}\) — kleinster Wert
- \(Q_1\) — unteres Quartil: Median der unteren Hälfte
- \(x_{\mathrm{Med}}\) — Median
- \(Q_3\) — oberes Quartil: Median der oberen Hälfte
- \(x_{\max}\) — größter Wert
Bei ungeradem \(n\) wird der Median beim Bilden der Hälften weggelassen.
Die Viertel-Regel
Jeder der vier Abschnitte — linke Antenne, linke Boxhälfte, rechte Boxhälfte, rechte Antenne — enthält rund 25 % der Werte. In der Box stecken also die mittleren 50 %.
Die Boxbreite \(Q_3 - Q_1\) misst die Streuung dieser mittleren Hälfte, die Spannweite \(x_{\max}-x_{\min}\) die Gesamtstreuung.
Boxplots vergleichen — in dieser Reihenfolge
| Was | woran ablesbar | Formulierung |
|---|---|---|
| Lage | Position des Medianstrichs | „A liegt insgesamt höher als B.“ |
| Streuung der Mitte | Boxbreite \(Q_3-Q_1\) | „Die mittleren 50 % streuen in A stärker.“ |
| Gesamtstreuung | Spannweite | „B reicht insgesamt weiter.“ |
| Schiefe | Medianstrich nicht mittig, Antennen ungleich lang | „Rechtsschief: die rechte Antenne ist länger.“ |
Alle Kennzahlen im Überblick
| Kennzahl | Formel / Bestimmung | Art | Einheit | Ausreißer |
|---|---|---|---|---|
| Arithmetisches Mittel \(\bar x\) | \(\tfrac{1}{n}\sum x_i\) | Lagemaß | wie die Daten | empfindlich |
| Median \(x_{\mathrm{Med}}\) | mittlerer Wert der Rangliste | Lagemaß | wie die Daten | robust |
| Modalwert \(x_{\mathrm{Mod}}\) | häufigster Merkmalswert | Lagemaß | wie die Daten | robust |
| Spannweite \(S_w\) | \(x_{\max}-x_{\min}\) | Streumaß | wie die Daten | sehr empfindlich |
| Boxbreite | \(Q_3-Q_1\) | Streumaß | wie die Daten | robust |
| Varianz \(s^2\) | \(\tfrac{1}{n}\sum (x_i-\bar x)^2\) | Streumaß | quadriert | empfindlich |
| Standardabweichung \(s\) | \(\sqrt{s^2}\) | Streumaß | wie die Daten | empfindlich |
Wichtige Bezeichnungen
| Zeichen | Bedeutung |
|---|---|
| \(n\) | Stichprobenumfang — Anzahl der Messwerte |
| \(x_i\) | der \(i\)-te Messwert (Urliste) bzw. \(i\)-te Wert der Rangliste |
| \(H(x)\) | absolute Häufigkeit des Merkmalswertes \(x\) |
| \(h(x)\) | relative Häufigkeit, \(h(x)=\tfrac{H(x)}{n}\) |
| \(m_j\) | Klassenmitte der \(j\)-ten Klasse |
| \(Q_1,\;Q_3\) | unteres und oberes Quartil |
