Übungsaufgaben — AFB III
Zehn Aufgaben auf dem Anforderungsbereich III: verallgemeinern, begründen, beurteilen. Fünf davon sind Applets, in denen Sie selbst konstruieren oder Fehler aufdecken; die fünf Textaufgaben verlangen zusammenhängende Begründungen. Die Musterlösungen sind ausführlich — lesen Sie sie erst, wenn Sie einen eigenen Ansatz notiert haben.
Konstruieren Sie eine Datenreihe aus sechs Messwerten mit dem arithmetischen Mittel \(\bar x = 10\) und der Spannweite \(S_w = 12\). Es gibt viele Lösungen — Sie brauchen nur eine.
Klick auf den Zahlenstrahl setzt einen Messwert, Klick auf einen Punkt wählt ihn aus. Mit der Tastatur: Tab auf einen Punkt, ←/→ verschiebt ihn, Entf löscht ihn.
Gegeben ist die Datenreihe 12; 14; 15; 16; 18. Der letzte Wert wird nun durch 118 ersetzt.
Untersuchen Sie, wie sich Median und arithmetisches Mittel dabei verändern, und begründen Sie allgemein, warum der Median gegen einzelne Ausreißer unempfindlich ist.
Musterlösung anzeigen (zählt als erledigt)
Ursprüngliche Reihe 12; 14; 15; 16; 18: Median \(= 15\); \(\bar x = \tfrac{75}{5} = 15\). Beide Kennzahlen stimmen hier überein.
Veränderte Reihe 12; 14; 15; 16; 118: Median \(= 15\) — unverändert; \(\bar x = \tfrac{175}{5} = 35\) — mehr als verdoppelt.
Begründung: Das arithmetische Mittel wird aus der Summe aller Werte gebildet. Jeder einzelne Zahlenwert geht mit seiner vollen Größe ein; wächst ein Wert um 100, wächst die Summe um 100 und der Mittelwert um \(\tfrac{100}{n}\). Der Median dagegen entsteht allein aus der Reihenfolge: Er ist der Wert an der mittleren Position. Solange ein Ausreißer der größte (oder der kleinste) Wert bleibt, ändert sich keine Position in der Rangliste — der Median bleibt exakt gleich, egal wie extrem der Ausreißer ist.
Folgerung für die Praxis: Bei stark unsymmetrischen Verteilungen — Einkommen, Mietpreise, Wartezeiten — ist der Median die ehrlichere Auskunft über den „typischen“ Wert. Das arithmetische Mittel wird trotzdem gebraucht, etwa wenn es auf die Gesamtsumme ankommt (Gesamtverbrauch, Gesamteinnahmen).
Eine Schülerin berechnet die Standardabweichung der Werte 2; 6; 7; 9.
Finden Sie alle fehlerhaften Zeilen und erklären Sie, worauf der erste Fehler zurückgeht.
Dieselben 200 Messwerte (Körpergrößen zwischen 150 cm und 200 cm) werden einmal in drei und einmal in zehn Klassen dargestellt.
Beurteilen Sie beide Darstellungen und entwickeln Sie eine Faustregel dafür, wie viele Klassen man wählen sollte.
Musterlösung anzeigen (zählt als erledigt)
Drei Klassen: Jede Klasse ist rund 17 cm breit. Die Darstellung ist übersichtlich, aber sie glättet zu stark — eine zweigipflige Verteilung oder ein auffälliger Bereich verschwindet vollständig in einem einzigen Balken. Auch der Mittelwert aus Klassenmitten wird ungenau, weil die Annahme „alle Werte liegen in der Klassenmitte“ bei 17 cm Breite grob ist.
Zehn Klassen: Jede Klasse ist 5 cm breit und enthält im Schnitt zwanzig Werte. Hier wird die Form der Verteilung sichtbar — ein Gipfel im Bereich 175 cm bis 185 cm und ein Auslaufen zu beiden Seiten. Treibt man die Einteilung weiter, etwa auf 25 Klassen zu 2 cm mit im Schnitt acht Werten je Klasse, erzeugen zufällige Schwankungen ein zackiges Bild, in dem man Struktur zu sehen glaubt, wo keine ist; der Vorteil des Klassierens — Übersicht — geht dann wieder verloren.
Faustregel: Die Klassenzahl \(k\) sollte etwa \(\sqrt{n}\) betragen, hier also rund 14; gebräuchlich sind 5 bis 20 Klassen. Zusätzlich gilt: Alle Klassen gleich breit, die Grenzen bei „runden“ Werten, und jede Klasse sollte mehrere Messwerte enthalten.
Grundsätzlich: Klassieren ist immer ein Tauschgeschäft — man gewinnt Übersicht und verliert Genauigkeit. Die Klassenzahl steuert, wie dieser Tausch ausfällt; sie ist eine Entscheidung und keine Rechnung.
Bauen Sie die Definition der empirischen Varianz aus den Bausteinen zusammen. Vier Bausteine gehören nicht dazu — überlegen Sie, welche Kennzahl aus ihnen entstünde.
Eine Zeitung meldet: „Das Durchschnittsvermögen der Erwachsenen in unserem Land beträgt 220 000 €. Der Wohlstand ist also hoch.“ In derselben Statistik steht weiter unten: Median 45 000 €.
Nehmen Sie Stellung zu dieser Schlagzeile. Erklären Sie insbesondere, wie beide Zahlen gleichzeitig richtig sein können, und welche Angabe die Leserschaft besser informiert.
Musterlösung anzeigen (zählt als erledigt)
Beide Zahlen können richtig sein. Vermögen ist stark rechtsschief verteilt: Sehr viele Menschen haben wenig, sehr wenige haben extrem viel. Weil in das arithmetische Mittel jeder Betrag mit seiner vollen Größe eingeht, ziehen wenige Milliardenvermögen den Durchschnitt weit nach oben. Der Median hängt dagegen nur von der mittleren Position ab und bleibt dort, wo die große Mehrheit liegt.
Zur Schlagzeile: Die Aussage „der Wohlstand ist hoch“ wird mit dem Mittelwert begründet, gemeint ist aber der typische Fall — und dafür ist der Mittelwert hier ungeeignet. Die Hälfte aller Erwachsenen besitzt höchstens 45 000 €. Der Abstand zwischen Median und Mittelwert ist selbst die interessante Information: Er ist ein Maß für die Ungleichverteilung.
Wann ist welche Zahl richtig? Für die Frage „Wie viel besitzt eine typische Person?“ ist der Median die richtige Auskunft. Für die Frage „Wie groß ist das Gesamtvermögen des Landes?“ braucht man dagegen genau den Mittelwert, denn \(\text{Gesamtsumme} = \bar x \cdot n\). Wer eine Statistik liest, sollte deshalb immer prüfen, ob die genannte Kennzahl zur behaupteten Aussage passt — und ob ein Streumaß mitgeliefert wird.
Eine Gemeinde wertet die Mietpreise von 480 Wohnungen aus. Wählen Sie in jedem Schritt die tragfähige Fortsetzung — eine falsche Wahl wird rot markiert, dann können Sie es erneut versuchen.
Zu jedem Messwert einer Datenreihe wird dieselbe Zahl \(c\) addiert (etwa, weil ein Messgerät um \(c\) falsch geeicht war).
Zeigen Sie, dass das arithmetische Mittel dabei um genau \(c\) wächst, die Standardabweichung sich aber nicht ändert. Erklären Sie anschließend anschaulich, warum das so sein muss.
Musterlösung anzeigen (zählt als erledigt)
Mittelwert. \(\overline{x+c} = \dfrac{1}{n}\sum_{i=1}^{n}(x_i+c) = \dfrac{1}{n}\Big(\sum x_i + n c\Big) = \bar x + c\).
Abweichungen. Für jeden Wert gilt \((x_i + c) - \overline{x+c} = (x_i + c) - (\bar x + c) = x_i - \bar x\). Das \(c\) hebt sich heraus: jede einzelne Abweichung bleibt gleich.
Varianz und Standardabweichung. Da die Varianz nur aus diesen Abweichungen gebildet wird, folgt \(s^2_{\text{neu}} = \dfrac{1}{n}\sum (x_i-\bar x)^2 = s^2\) und damit \(s_{\text{neu}} = s\).
Anschaulich. Das Addieren von \(c\) verschiebt alle Punkte auf dem Zahlenstrahl um dieselbe Strecke nach rechts. Die Abstände zwischen den Punkten und damit auch zum mitwandernden Mittelwert bleiben dabei unverändert. Streumaße messen genau diese Abstände — also können sie sich nicht ändern.
Zum Vergleich: Wird stattdessen jeder Wert mit \(k\) multipliziert, so gilt \(\bar x \to k\bar x\) und \(s \to |k|\cdot s\) — dort ändert sich die Streuung sehr wohl, weil sich alle Abstände um den Faktor \(k\) dehnen. Genau deshalb ist ein Einheitenwechsel (m in cm) eine Multiplikation und keine Verschiebung.
Zwölf Messwerte, bereits geordnet: 5; 7; 8; 10; 12; 14; 16; 17; 19; 21; 23; 28
Bestimmen Sie die Fünf-Punkte-Zusammenfassung und setzen Sie die Marken. Achten Sie darauf, dass \(n\) hier gerade ist und auch die beiden Hälften gerade viele Werte enthalten.
Zu setzen sind Minimum, \(Q_1\), Median, \(Q_3\) und Maximum der zwölf Werte.
Zwei Messreihen mit je 200 Werten haben dieselbe Box (\(Q_1 = 40\), Median \(= 50\), \(Q_3 = 60\)), aber sehr unterschiedliche Antennen: Reihe A reicht von 35 bis 66, Reihe B von 5 bis 140.
Erklären Sie, welche Aussagen über die beiden Reihen dennoch übereinstimmen und welche nicht. Beurteilen Sie, ob die Behauptung „Reihe B enthält mehr Werte“ aus den Boxplots folgt.
Musterlösung anzeigen (zählt als erledigt)
Was übereinstimmt: Beide Reihen haben denselben Median (50) und dieselbe Boxbreite (\(60-40 = 20\)). In beiden liegen also rund 100 der 200 Werte zwischen 40 und 60, und in beiden liegen rund 100 Werte unter 50. Lage und Streuung der mittleren Hälfte sind identisch.
Was sich unterscheidet: Die Spannweite. Reihe A streut insgesamt über 31 Einheiten, Reihe B über 135. In B gibt es also einzelne Werte, die weit vom Zentrum entfernt liegen — im äußeren Viertel verteilen sich die rund 50 Werte über einen viel größeren Bereich. Die Verteilungen sind an den Rändern völlig verschieden, obwohl ihre Mitte gleich ist.
Zur Behauptung: Sie folgt nicht. Ein Boxplot zeigt keine Anzahlen, sondern nur Positionen auf der Merkmalsachse. Eine längere Antenne bedeutet, dass sich das äußere Viertel über eine größere Strecke erstreckt — nicht, dass es mehr Werte enthält. Beide Reihen haben nach Voraussetzung genau 200 Werte.
Konsequenz: Boxplots sind zum Vergleichen hervorragend, aber sie sind eine Zusammenfassung. Wer wissen will, ob eine Verteilung zwei Gipfel hat oder wie sich die Werte innerhalb der Box häufen, braucht zusätzlich ein Histogramm.
