ASCII- und Unicode-Codes

Zeigt den Codepoint jedes Zeichens, oder macht aus Dezimal- und Hex-Codes wieder Text.

Codepoints, keine Hex-Bytes

ASCII sind die Zahlen 0 bis 127. Ein chinesisches Zeichen ist kein einzelnes ASCII-Byte, sondern ein Unicode-Codepoint, und in UTF-8 sind das mehrere Bytes. Diese Seite druckt pro Zeichen eine Zahl, dezimal oder hexadezimal. Den UTF-8-Dump liefert sie nicht. Dafür nehmen Sie Zeichenkette zu Bytes oder Text nach Binär.

So gehen Sie vor

  1. Fügen Sie Text ein, oder Codes, getrennt durch Leerzeichen, Kommas oder Zeilenumbrüche.
  2. Wählen Sie Text nach Codes oder Codes nach Text, dann Dezimal oder Hexadezimal.
  3. Das Beispiel AB ist dezimal 65 66 und hexadezimal 41 42.
  4. Ist ein Token keine Zahl im gewählten System oder kein gültiger Zeichencode, ist die ganze Eingabe ein Fehler. Das schlechte Token wird nicht übersprungen.

Welche Zahl Sie sehen

65 ist das Zeichen A, 20013 ist 中. Beides sind keine UTF-8-Bytes. Die UTF-8-Bytes von 中 sind E4 B8 AD. Zeigt ein anderes Werkzeug für ein Zeichen drei Hex-Paare, zeigt es Bytes, und die Zahlen passen erst, wenn Sie das Werkzeug wechseln. Hex hier hat weder 0x noch U+. Auf dem Weg von Codes zurück zum Text sind Leerzeichen, Kommas und Umbrüche Trenner, keine Zeichen im Ergebnis.

Wann Sie es brauchen

  • Ein dezimaler Codepoint aus einer Spezifikation oder einer Fehlermeldung.
  • Zwei Zeichen sehen gleich aus, und Sie wollen wissen, welches es ist.
  • Eine kurze Codeliste für eine Parser-Übung.

Fragen

Warum ist 中 nicht 228 oder E4?

Das sind UTF-8-Bytes. Diese Seite druckt den Codepoint, eine Zahl pro Zeichen.

Ein Emoji wurde eine Zahl, nicht zwei.

Die Zahl ist der Codepoint. Ein Emoji kann ein Punkt über 65535 sein oder eine Folge mehrerer Punkte. Jeder Punkt ist eine Zahl.