MINT lernen

Übungen: ASCII & Unicode

Zeichen und Codes einander zuordnen, die Bereichsgrenzen der ASCII-Tabelle nutzen und erklären, warum Umlaute und Emojis Unicode brauchen.

Zum NachschlagenZurück zur ErklärungASCII & Unicode — Erklärung, Glossar und Video nachlesen.
Fortschritt
0 / 0 Aufgaben
Übungsaufgaben

Jetzt bist du dran

1

Welches Zeichen ist gemeint?

AFB I

Zu welchem Zeichen gehört der ASCII-Code 74?

2

Codes zuordnen

AFB II

Welcher ASCII-Code gehört zu welchem Zeichen? Nutze die Bereichsgrenzen aus der Tabelle.

Die Ziffer 7
Der Großbuchstabe Z
Der Kleinbuchstabe e
Ein Zeilenumbruch
Merke dir drei Startpunkte: Ziffern beginnen bei 48, Großbuchstaben bei 65, Kleinbuchstaben bei 97.
Von dort aus weiterzählen: Z ist der 26. Großbuchstabe, also 65 + 25. Und Steuerzeichen liegen immer unter 32.
3

Ein Wort codieren — und nachrechnen

AFB II

Rechne durch, wie viel Platz Wörter in ASCII und in UTF-8 belegen.

Rechne die Kette Schritt für Schritt: Erst wenn ein Schritt stimmt, wird der nächste freigeschaltet. Enter prüft.
  1. Wie viele Zeichen hat das Wort „Byte“? Zeichen
  2. Wie viele Bit belegt „Byte“ in ASCII? (1 Byte pro Zeichen) Bit
  3. „Größe“ hat 5 Zeichen, das „ö“ belegt in UTF-8 2 Byte. Wie viele Byte sind es insgesamt? Byte
  4. Der ASCII-Code von „a“ ist 97. Welchen Code hat „y“?
  5. Wie viele verschiedene Zeichen kann ASCII mit 7 Bit darstellen? Zeichen
ASCII nutzt 7 Bit und reicht damit nur für englische Zeichen — belegt beim Speichern aber trotzdem ein volles Byte pro Zeichen. UTF-8 ist dagegen variabel lang: Es beginnt bei 1 Byte und passt sich nach oben an — deshalb ist die Zeichenzahl dort nicht mehr gleich der Byte-Zahl.
In ASCII ist jedes Zeichen genau 1 Byte. In UTF-8 belegen Umlaute 2 Byte, normale Buchstaben 1 Byte.
4

Trickfrage: der kaputte Dateiname

AFB III

Aus „Prüfung.txt“ wird auf einem anderen Rechner plötzlich „Prüfung.txt“. Spiele durch, wie das passieren kann.

Spiele den Ablauf Schritt für Schritt durch: Was passiert als Nächstes? Nur die richtige Karte bringt dich weiter.
    Bytes tragen keine Information darüber, wie sie zu lesen sind. Erst die Codierungsangabe macht aus Zahlen Zeichen — passt sie nicht, entsteht Zeichensalat. Weil UTF-8 die ersten 128 Zeichen genau wie ASCII ablegt, fallen nur die Umlaute auf.
    Auf der Festplatte stehen nur Bytes. Erst die Codierung legt fest, welches Zeichen daraus wird.
    5

    Paare finden: Begriff und Bedeutung

    AFB I

    Acht Fachbegriffe rund um Zeichencodierung — finde zu jedem die passende Beschreibung. Du hast dafür höchstens 16 Versuche.

    Decke zwei Karten auf, die zusammengehören. Mit der Tastatur: Tab zur Karte, Enter aufdecken, Pfeiltasten zum Wandern.
    Versuche: 0 von 16
    Der wichtigste Denkschritt: Unicode vergibt Nummern, UTF-8 speichert sie. Erst beide zusammen ergeben eine funktionierende Textdatei — und wenn beim Öffnen die falsche Codierung angenommen wird, entstehen die bekannten Zeichensalat-Fehler.
    Unterscheide sauber: Ein Codepoint ist eine Nummer, eine Codierung ist die Regel, wie diese Nummer zu Bytes wird.
    6

    Was gilt für UTF-8?

    AFB II

    Drei Aussagen sind richtig. Markiere genau diese drei.

    Mehrere Antworten sind richtig. Markiere alle zutreffenden und klicke dann auf „Prüfen“.
    Die variable Länge ist der ganze Trick: Häufige Zeichen bleiben kurz, seltene dürfen länger sein. Deshalb ist eine reine ASCII-Datei in UTF-8 kein Byte größer als vorher — und deshalb stimmen Zeichenanzahl und Byteanzahl bei Umlauten oder Emojis nicht mehr überein.
    Denke an den Grund, warum UTF-8 sich weltweit durchgesetzt hat: Es musste zu bereits vorhandenen Textdateien passen.
    7

    Drei Codierungen im Vergleich

    AFB II

    Kreuze für jede Codierung an, was zutrifft. Mehrere Kreuze pro Zeile sind möglich.

    Setze in jeder Zeile überall dort ein Kreuz, wo die Aussage zutrifft — es können mehrere pro Zeile sein. Enter setzt und löscht.
    CodierungJedes Zeichen belegt genau ein ByteKann ä und é speichernKann Emojis speichernZeichen können unterschiedlich viele Bytes belegen
    ASCII
    Latin-1
    UTF-8
    Die Tabelle zeigt den historischen Weg: ASCII konnte wenig, aber einheitlich. Latin-1 stopfte westeuropäische Lücken. UTF-8 kann alles — und bezahlt dafür mit variabler Länge. Genau diese Flexibilität hat es zum Standard des Webs gemacht.
    Nur eine der drei Codierungen hat variable Zeichenlängen — und genau die kann auch Emojis.
    8

    Stimmt das? Fünf Aussagen zur Zeichencodierung

    AFB II

    Stimmt die Aussage? Eine Fehleinschätzung beendet die Serie.

    5 Aussagen nacheinander. Eine falsche Einschätzung reicht — dann startest du die Serie mit „Neue Runde“ neu.
    Aussage 1 von 5

    Die wichtigste Trennung dieses Häppchens steckt in Aussage 2: Nummer (Codepoint), Speicherform (UTF-8) und Aussehen (Schriftart) sind drei verschiedene Ebenen — Fehler entstehen, wenn man sie verwechselt.
    Unterscheide streng: Was ist Nummer, was ist Speicherung, was ist Darstellung?
    9

    Wie viele Bytes braucht das Zeichen?

    AFB I

    Ordne jedes Zeichen dem Speicherplatz zu, den es in UTF-8 belegt.

    Ziehe jede Karte in den passenden Korb — oder wähle sie mit Enter aus und drücke dann die Ziffer des Korbs (0 legt sie zurück).
    11 Byte
    22 Byte
    33 oder 4 Byte
    Die Faustregel: ASCII = 1 Byte, europäische Sonderzeichen = 2 Byte, alles Fernere = 3–4 Byte. Je später ein Zeichen ins Unicode-Verzeichnis kam, desto größer sein Codepoint — und desto mehr Bytes braucht er.
    Alles, was auf einer amerikanischen Schreibmaschine steht, ist ASCII — und damit 1 Byte.
    10

    Welche Codierung nimmst du?

    AFB II

    Du speicherst die Nachrichten einer Chat-App, in der Umlaute und Emojis vorkommen sollen. Arbeite dich durch die Entscheidungsfragen.

    Beantworte die Fragen des Entscheidungsbaums mit Ja oder Nein und schau, wo du herauskommst.
      In der Praxis endet fast jeder Weg bei UTF-8 — und das ist die eigentliche Erkenntnis: Es gibt heute kaum noch einen Grund, etwas anderes zu wählen. Die anderen Codierungen muss man vor allem kennen, um alte Dateien und Mojibake-Fehler zu verstehen.
      Eine Chat-App mit Emojis beantwortet die erste Frage schon eindeutig.
      11

      Fehlersuche: der Spickzettel zur Zeichencodierung

      AFB III

      Auf diesem Merkzettel stehen sechs Sätze — drei davon sind falsch. Klicke genau diese drei an.

      In diesem Text stecken Fehler. Klicke genau die falschen Zeilen an — die richtigen musst du stehen lassen.
      Alle drei Fehler entstehen aus derselben Verwechslung: Verzeichnis (Unicode) und Speicherform (UTF-8) sind zwei getrennte Dinge, und UTF-8 wurde gezielt so entworfen, dass ASCII-Texte unverändert bleiben.
      Zwei der Fehler behaupten etwas über Größe und Speicherung — prüfe diese Sätze besonders streng.
      12

      Rückblick: Hexadezimal aus 2.1.3

      AFB II

      Der Buchstabe A hat den Unicode-Codepunkt U+0041. Welche Dezimalzahl steht dahinter?

      Die vier Zeichen hinter dem U+ sind hexadezimal. Rechne stellenweise: die vordere 4 zählt sechzehnfach, die hintere 1 einfach.