ASCII와 유니코드 코드

글자마다 코드 포인트를 보여 주거나, 10진수·16진수 코드를 다시 글로 바꿉니다.

코드 포인트입니다. 16진수 바이트가 아닙니다

ASCII는 0부터 127입니다. 한자는 ASCII 바이트 하나가 아니라 유니코드 코드 포인트이고, UTF-8에서는 그 포인트가 바이트 여러 개입니다. 이 페이지는 글자마다 숫자를 하나 찍습니다. 10진수와 16진수 모두 됩니다. UTF-8 바이트 나열은 하지 않습니다. 바이트는 문자열을 바이트로나 텍스트를 이진수로에서 봅니다.

쓰는 순서

  1. 글, 또는 공백·쉼표·줄바꿈으로 나눈 코드를 붙여 넣습니다.
  2. 글을 코드로, 또는 코드를 글로 고른 다음 10진수나 16진수를 고릅니다.
  3. 예시 AB의 10진수는 65 66이고, 16진수는 41 42입니다.
  4. 고른 진법의 숫자가 아니거나 올바른 문자 코드가 아니면 전체가 오류입니다. 나쁜 토큰만 건너뛰지 않습니다.

보고 있는 숫자

65는 A이고 20013은 中입니다. 둘 다 UTF-8 바이트가 아닙니다. 中의 UTF-8 바이트는 E4 B8 AD입니다. 다른 도구가 한 글자에 16진수 쌍을 세 개 보여 주면 바이트를 보여주는 것이라, 이 페이지와 숫자가 맞지 않습니다. 도구를 바꿔야 합니다. 여기 16진수에는 0x도 U+도 없습니다. 코드에서 글로 돌아올 때 공백, 쉼표, 줄바꿈은 구분이지 결과에 들어가지 않습니다.

이럴 때

  • 명세나 오류 메시지의 10진수 코드 포인트를 읽을 때.
  • 비슷해 보이는 두 글자 중 어느 쪽인지 확인할 때.
  • 파서 연습용으로 짧은 코드 열을 만들 때.

자주 묻는 말

中이 228이나 E4가 아닌 이유는 무엇입니까?

그건 UTF-8 바이트입니다. 이 페이지는 글자마다 하나인 코드 포인트를 찍습니다.

이모지가 숫자 하나가 되었습니다.

그 숫자가 코드 포인트입니다. 이모지는 65535보다 큰 포인트 하나일 수도, 포인트 여러 개일 수도 있습니다. 포인트마다 숫자 하나입니다.