MINT lernen

Automatisierte Datenanalyse

Ein Algorithmus entscheidet in Millisekunden, wer auf Rechnung kaufen darf — aber nach welchen Daten?

1

Muster in großen Datenmengen

  • Big Data:riesige, schnell wachsende und sehr unterschiedliche Datenmengen — Klicks, Standorte, Einkäufe, Sensorwerte.
  • Automatisiert:Programme suchen ohne menschliches Zutun nach Mustern; technisch oft nichts anderes als GROUP BY und Verbund über Millionen Zeilen.
  • Profilbildung:verknüpft man Tabellen verschiedener Quellen über gemeinsame Merkmale, entsteht ein Bild einer Person, das sie selbst nie preisgegeben hat.
  • Scoring:aus den Daten wird ein Punktwert berechnet, der Verhalten vorhersagen soll — z. B. ob jemand eine Rechnung bezahlt.
  • Chancen:Krankheiten früher erkennen, Betrug aufdecken, Verkehr und Energie besser steuern.
  • Risiken:Fehlentscheidungen, Diskriminierung, Überwachung, Verlust der Kontrolle über die eigenen Daten.
2

Entscheidungen aus Daten

  • Korrelation:ein Zusammenhang in den Daten ist noch kein Grund: Wer im Süden wohnt, zahlt nicht deshalb schlechter.
  • Stellvertreter:auch scheinbar neutrale Merkmale wie die Postleitzahl können für Herkunft oder Einkommen stehen und so diskriminieren.
  • Fehlerarten:zu Unrecht abgelehnt oder zu Unrecht angenommen — jede Schwelle verschiebt nur, wen es trifft.
  • Art. 22 DSGVO:niemand muss sich einer Entscheidung mit rechtlicher oder ähnlich erheblicher Wirkung unterwerfen, die ausschließlich automatisiert fällt.

Ein Onlinehändler gewährt „Kauf auf Rechnung“ nur ab einem bestimmten Score. Ziehe die Schwelle (oder nutze die Pfeiltasten) und vergleiche, wen es in den beiden Stadtteilen trifft.

Wo liegt die Schwelle?

Halte fest: Der Score ist im Süden bei gleichem Zahlungsverhalten niedriger, weil die Postleitzahl einfließt. Eine einzige Schwelle behandelt dann zuverlässige Menschen im Süden häufiger ungerecht — egal, wo man sie hinschiebt.

Merke

Art. 22 DSGVO: Ausschließlich automatisierte Entscheidungen mit erheblicher Wirkung sind nur in Ausnahmen erlaubt — Betroffene können das Eingreifen eines Menschen verlangen.

3

Allgemeine Hinweise

Korrelation ist keine Ursache

Dass zwei Merkmale gemeinsam auftreten, erklärt nicht, warum. Wer aus Zusammenhängen Entscheidungen über Menschen ableitet, muss das begründen können.

Daten sind nie neutral

Ein Score übernimmt die Muster seiner Trainingsdaten — auch alte Ungerechtigkeiten. Fehlende Merkmale wie „Herkunft“ schützen nicht, wenn Stellvertreter wie die PLZ im Modell stecken.

Beurteilen mit Kriterien

In Abituraufgaben Chancen und Risiken gegenüberstellen: Wer profitiert, wer ist betroffen, wie hoch sind Fehlerquoten, wer kann widersprechen? Dann erst urteilen.

Videos