Codici ASCII e Unicode

Mostra il punto di codice di ogni carattere, o riporta codici decimali o esadecimali a testo.

Punti di codice, non byte in esadecimale

L’ASCII sono i numeri da 0 a 127. Un carattere cinese non è un byte ASCII: è un punto di codice Unicode, e in UTF-8 quel punto occupa più byte. Questa pagina stampa un numero per carattere, in decimale o in esadecimale. Non produce il dump esadecimale dei byte UTF-8. Per quei byte usa stringa in byte o testo in binario.

Come si usa

  1. Incolla del testo, o un elenco di codici separati da spazi, virgole o a capo.
  2. Scegli «Testo in codici» o «Codici in testo», poi Decimale o Esadecimale.
  3. L’esempio AB è 65 66 in decimale. In esadecimale sono 41 42.
  4. Un token che non è un numero nella base scelta, o un numero che non è un carattere, è un errore. La pagina non salta il token sbagliato.

Quale numero stai guardando

65 è il carattere A. 20013 è il carattere 中. Nessuno dei due è un byte UTF-8: i byte UTF-8 di 中 sono E4 B8 AD. Se un altro strumento mostra tre coppie esadecimali per un carattere, sta mostrando byte, e questa pagina non coinciderà finché non cambi strumento. L’esadecimale qui non ha prefisso 0x né U+. Tornando dai codici al testo, spazi, virgole e a capo sono separatori, non caratteri da codificare.

Dove si usa

  • Leggere un punto di codice decimale preso da una specifica o da un messaggio di errore.
  • Verificare che un carattere sia quello che credi, quando due si somigliano.
  • Preparare un elenco corto di codici per un esercizio sul parser.

Domande

Perché 中 non è 228 né E4?

Quelli sono valori di byte in UTF-8. Questa pagina stampa il punto di codice: un numero per carattere.

Un’emoji è diventata un solo numero, non due.

Il numero è il punto di codice. Un’emoji può essere un solo punto sopra 65535, oppure più punti se è una sequenza. Ogni punto è un numero.