MINT lernen

Zusammenfassung

Alle Definitionen, Formeln und Kennzahlen des Kapitels 6 von der Datenerhebung bis zum Boxplot auf einer Seite.

Zum NachschlagenZurück zur KapitelübersichtAlle Unterkapitel von Kapitel 6 auf einen Blick.
6.1

Daten erheben — die Grundbegriffe

Jede statistische Untersuchung beginnt mit drei Festlegungen. Sie klingen selbstverständlich, entscheiden aber darüber, was die späteren Zahlen überhaupt bedeuten.

Grundgesamtheit

Die Menge aller Objekte, über die eine Aussage gemacht werden soll — zum Beispiel alle 1240 Personen einer Schule. Sie muss vor der Erhebung klar abgegrenzt sein.

Stichprobe

Der tatsächlich untersuchte Teil der Grundgesamtheit. Ihre Größe heißt Stichprobenumfang \(n\). Aus ihr wird auf die Grundgesamtheit geschlossen.

Merkmal

Die Eigenschaft, die an jedem Element erhoben wird (Körpergröße, Note, Verkehrsmittel). Die einzelnen möglichen Antworten heißen Merkmalswerte oder Ausprägungen.

Repräsentativ heißt eine Stichprobe, wenn sie die Grundgesamtheit in den wesentlichen Merkmalen abbildet. Das erreicht man durch zufällige Auswahl, nicht durch eine große Stichprobe: Eine systematisch verzerrte Auswahl bleibt verzerrt, auch wenn man zehnmal so viele Personen befragt.

Absolute und relative Häufigkeit

Relative Häufigkeit
\(h(x) = \dfrac{H(x)}{n}\)\(H(x)\): absolute Häufigkeit — wie oft der Merkmalswert \(x\) vorkommt. \(n\): Stichprobenumfang. Es gilt stets \(0 \le h(x) \le 1\), und alle relativen Häufigkeiten zusammen ergeben 1 (also 100 %).
Darstellungwofür geeignetBesonderheit
Säulendiagrammwenige, klar getrennte MerkmalswerteSäulen stehen mit Abstand nebeneinander
KreisdiagrammAnteile an einem GanzenSektorwinkel \(\alpha = h(x)\cdot 360^{\circ}\)
Histogrammklassierte MesswerteBalken grenzen lückenlos aneinander
BoxplotVergleich mehrerer Verteilungenzeigt fünf Punkte, keine Anzahlen
6.2

Lagemaße — wo liegen die Daten?

Ein Lagemaß fasst eine ganze Datenreihe zu einer einzigen Zahl zusammen, die für ihre Position steht. Drei Lagemaße kommen im Kapitel vor; sie beantworten dieselbe Frage auf unterschiedliche Weise.

Arithmetisches Mittel
\(\bar x = \dfrac{1}{n}\displaystyle\sum_{i=1}^{n} x_i = \dfrac{x_1 + x_2 + \dots + x_n}{n}\)Benutzt jeden einzelnen Zahlenwert. Umgestellt liefert die Formel die Gesamtsumme: \(\sum x_i = \bar x \cdot n\) — damit lassen sich fehlende Einzelwerte zurückrechnen.

Median \(x_{\mathrm{Med}}\)

Der Wert in der Mitte der Rangliste. Zuerst sortieren, dann:

  • \(n\) ungerade: der mittlere Wert, also \(x_{(n+1)/2}\)
  • \(n\) gerade: das Mittel der beiden mittleren Werte

Mindestens 50 % der Werte sind kleiner oder gleich, mindestens 50 % größer oder gleich dem Median.

Modalwert \(x_{\mathrm{Mod}}\)

Der am häufigsten vorkommende Merkmalswert. Er ist immer selbst ein Messwert, kann aber mehrfach vorkommen (zwei Gipfel) oder wenig aussagekräftig sein, wenn alle Werte etwa gleich oft auftreten. Als einziges Lagemaß funktioniert er auch bei nicht-numerischen Merkmalen.

Spannweite \(S_w\)

\(S_w = x_{\max} - x_{\min}\). Streng genommen kein Lagemaß, sondern das einfachste Streumaß. Sie benutzt nur die beiden Randwerte und wird deshalb von einem einzigen Ausreißer vollständig bestimmt.

Robustheit. Wird ein einzelner Wert extrem groß, wandert das arithmetische Mittel mit — der Median bleibt stehen, solange sich die Reihenfolge nicht ändert. Bei schiefen Verteilungen (Einkommen, Mieten, Wartezeiten) beschreibt deshalb der Median den typischen Fall besser.
020406080100120x̄ = 35Messwert x
Ein einziger Ausreißer zieht das arithmetische Mittel nach rechts — der Median bleibt bei 15.
6.3

Klassierte Messwerte

Bei vielen verschiedenen Messwerten wird jede Einzelauflistung unübersichtlich. Man fasst dann benachbarte Werte zu Klassen zusammen. Das schafft Übersicht und kostet Genauigkeit — dieser Tausch ist der Kern des Abschnitts.

Regeln für die Klassenbildung

  • alle Klassen gleich breit
  • lückenlos und überschneidungsfrei — jeder Wert gehört zu genau einer Klasse
  • Klassenzahl \(k \approx \sqrt{n}\), üblich sind 5 bis 20
  • Klassenbreite \(b \ge \dfrac{S_w}{k}\), aufgerundet auf einen glatten Wert

Klassenmitte

\(m = \dfrac{\text{untere Grenze} + \text{obere Grenze}}{2}\)

Nach dem Klassieren sind die Einzelwerte verloren. Man rechnet so, als läge jeder Wert genau in der Mitte seiner Klasse.

Mittelwert aus Klassenmitten
\(\bar x \approx \dfrac{1}{n}\displaystyle\sum_{j} m_j \cdot H_j\)\(m_j\): Klassenmitte der \(j\)-ten Klasse, \(H_j\): ihre absolute Häufigkeit. Das Ergebnis ist ein Näherungswert — der exakte Mittelwert lässt sich aus klassierten Daten nicht mehr zurückgewinnen.
02468101249125010203040H(x)Fahrzeit (in min)
Histogramm: die Balken grenzen lückenlos aneinander — anders als beim Säulendiagramm.
Ein Histogramm ist kein Säulendiagramm. Die Lücken im Säulendiagramm zeigen an, dass die Merkmalswerte getrennt sind (Note 1, Note 2, …). Im Histogramm gibt es keine Lücken, weil das Merkmal stetig ist: zwischen 19,9 min und 20,1 min liegt jeder Zwischenwert. Bei gleich breiten Klassen ist die Balkenhöhe die Häufigkeit; bei ungleich breiten Klassen wäre die Fläche die Häufigkeit.
6.4

Streumaße — wie weit liegen die Daten auseinander?

Zwei Datenreihen können denselben Mittelwert haben und trotzdem völlig verschieden aussehen. Erst ein Streumaß macht diesen Unterschied messbar. Die Spannweite reicht dafür nicht, weil sie nur zwei Werte kennt — gebraucht wird ein Maß, in das alle Werte eingehen.

Empirische Varianz
\(s^2 = \dfrac{1}{n}\displaystyle\sum_{i=1}^{n}\left(x_i - \bar x\right)^2\)Der mittlere quadratische Abstand vom arithmetischen Mittel. Quadriert wird, weil sich die unquadrierten Abweichungen immer zu 0 aufheben. Die Einheit ist deshalb die quadrierte Einheit der Messwerte.
Empirische Standardabweichung
\(s = \sqrt{s^2} = \sqrt{\dfrac{1}{n}\displaystyle\sum_{i=1}^{n}\left(x_i - \bar x\right)^2}\)Die Wurzel führt zurück auf die Einheit der Messwerte — deshalb wird für die Interpretation fast immer \(s\) angegeben und nicht \(s^2\). Es gilt stets \(s \ge 0\), und \(s = 0\) genau dann, wenn alle Messwerte gleich sind.

Rechenweg in fünf Schritten

Schrittwas zu tun istKontrolle
1\(\bar x\) berechnenliegt zwischen kleinstem und größtem Wert
2alle Abweichungen \(x_i - \bar x\) bildenihre Summe muss 0 ergeben
3jede Abweichung quadrierenalle Ergebnisse sind \(\ge 0\)
4Quadrate addieren und durch \(n\) teilen \(\to s^2\)Einheit ist quadriert
5Wurzel ziehen \(\to s\)\(s\) ist kleiner als die Spannweite
Verschieben und Strecken. Addiert man zu allen Werten dieselbe Zahl \(c\), so wächst \(\bar x\) um \(c\), während \(s\) unverändert bleibt — alle Abstände bleiben ja gleich. Multipliziert man alle Werte mit \(k\), so wird \(\bar x\) zu \(k\bar x\) und \(s\) zu \(|k|\cdot s\). Ein Einheitenwechsel von m nach cm ist eine solche Multiplikation.
6.5

Quartile und Boxplots

Der Boxplot fasst eine Verteilung zu fünf Zahlen zusammen und macht sie damit vergleichbar. Er gehört zum Median, so wie die Standardabweichung zum arithmetischen Mittel gehört.

Die fünf Punkte

  • \(x_{\min}\) — kleinster Wert
  • \(Q_1\) — unteres Quartil: Median der unteren Hälfte
  • \(x_{\mathrm{Med}}\) — Median
  • \(Q_3\) — oberes Quartil: Median der oberen Hälfte
  • \(x_{\max}\) — größter Wert

Bei ungeradem \(n\) wird der Median beim Bilden der Hälften weggelassen.

Die Viertel-Regel

Jeder der vier Abschnitte — linke Antenne, linke Boxhälfte, rechte Boxhälfte, rechte Antenne — enthält rund 25 % der Werte. In der Box stecken also die mittleren 50 %.

Die Boxbreite \(Q_3 - Q_1\) misst die Streuung dieser mittleren Hälfte, die Spannweite \(x_{\max}-x_{\min}\) die Gesamtstreuung.

051015202530Messwert xMinQ₁MedQ₃Max
Die fünf Punkte eines Boxplots: Antennenenden, Boxkanten und Medianstrich.

Boxplots vergleichen — in dieser Reihenfolge

Wasworan ablesbarFormulierung
LagePosition des Medianstrichs„A liegt insgesamt höher als B.“
Streuung der MitteBoxbreite \(Q_3-Q_1\)„Die mittleren 50 % streuen in A stärker.“
GesamtstreuungSpannweite„B reicht insgesamt weiter.“
SchiefeMedianstrich nicht mittig, Antennen ungleich lang„Rechtsschief: die rechte Antenne ist länger.“
Was ein Boxplot nicht zeigt: die Anzahl der Werte, die einzelnen Messwerte und die Form der Verteilung innerhalb der Box. Eine breite Box bedeutet größere Streuung, nicht mehr Werte. Für die Verteilungsform braucht man zusätzlich ein Histogramm.
∑

Alle Kennzahlen im Überblick

KennzahlFormel / BestimmungArtEinheitAusreißer
Arithmetisches Mittel \(\bar x\)\(\tfrac{1}{n}\sum x_i\)Lagemaßwie die Datenempfindlich
Median \(x_{\mathrm{Med}}\)mittlerer Wert der RanglisteLagemaßwie die Datenrobust
Modalwert \(x_{\mathrm{Mod}}\)häufigster MerkmalswertLagemaßwie die Datenrobust
Spannweite \(S_w\)\(x_{\max}-x_{\min}\)Streumaßwie die Datensehr empfindlich
Boxbreite\(Q_3-Q_1\)Streumaßwie die Datenrobust
Varianz \(s^2\)\(\tfrac{1}{n}\sum (x_i-\bar x)^2\)Streumaßquadriertempfindlich
Standardabweichung \(s\)\(\sqrt{s^2}\)Streumaßwie die Datenempfindlich
Die beiden Paare. Zusammen gehören \(\bar x\) und \(s\) auf der einen Seite, \(x_{\mathrm{Med}}\) und die Quartile (Boxplot) auf der anderen. Eine Auswertung nennt immer ein Lagemaß und ein dazu passendes Streumaß — eine Zahl allein beschreibt keine Verteilung.

Wichtige Bezeichnungen

ZeichenBedeutung
\(n\)Stichprobenumfang — Anzahl der Messwerte
\(x_i\)der \(i\)-te Messwert (Urliste) bzw. \(i\)-te Wert der Rangliste
\(H(x)\)absolute Häufigkeit des Merkmalswertes \(x\)
\(h(x)\)relative Häufigkeit, \(h(x)=\tfrac{H(x)}{n}\)
\(m_j\)Klassenmitte der \(j\)-ten Klasse
\(Q_1,\;Q_3\)unteres und oberes Quartil
ÜbenÜbungen AFB I bis IIIDreißig gemischte Aufgaben zum ganzen Kapitel — vom Reproduzieren bis zum Begründen.WiederholenLernkartenDreißig Karten mit Begriffen und Formeln zum Abfragen.