Коды ASCII и Unicode

Показывает код каждого символа или собирает текст из десятичных или шестнадцатеричных кодов.

Коды символов, не шестнадцатеричные байты

ASCII — это числа от 0 до 127. Иероглиф не является одним байтом ASCII: это код Unicode, а в UTF-8 такой код занимает несколько байтов. Страница печатает одно число на символ, в десятичной или шестнадцатеричной записи. Шестнадцатеричный дамп байтов UTF-8 она не строит. Байты смотрите в строка в байты или текст в двоичный вид.

Как пользоваться

  1. Вставьте текст или список кодов через пробел, запятую или перевод строки.
  2. Выберите «Текст в коды» или «Коды в текст», затем десятичную или шестнадцатеричную систему.
  3. Пример AB — это 65 66 в десятичной записи. В шестнадцатеричной — 41 42.
  4. Жетон, который не является числом в выбранной системе, или число, которое не является символом, — ошибка. Плохой жетон страница не пропускает.

Какое число перед вами

65 — это символ A. 20013 — это символ 中. Ни то ни другое не байт UTF-8: байты UTF-8 для 中 — это E4 B8 AD. Если другой инструмент показывает три шестнадцатеричные пары на один знак, он показывает байты, и с этой страницей они не совпадут, пока вы не смените инструмент. Здешняя шестнадцатеричная запись без 0x и без U+. На обратном пути пробел, запятая и перевод строки — разделители, а не символы для кодирования.

Где это нужно

  • Прочитать десятичный код из спецификации или из сообщения об ошибке.
  • Убедиться, что символ именно тот, когда два похожи.
  • Собрать короткий список кодов для упражнения с разбором.

Вопросы

Почему 中 — это не 228 и не E4?

Это байтовые значения в UTF-8. Страница печатает код символа: одно число на знак.

Эмодзи стало одним числом, а не двумя.

Число и есть код. Эмодзи может быть одним кодом выше 65535 или несколькими кодами, если это последовательность. Каждый код — отдельное число.