유니코드 문자 조회

문자 코드포인트 10진수 블록 UTF-8 UTF-16 HTML 엔티티

코드값 → 문자

문자 코드포인트 10진수 블록 UTF-8 UTF-16 HTML 엔티티

유니코드 코드포인트란

컴퓨터가 표시할 수 있는 모든 문자(글자, 숫자, 문장부호, 한중일 문자, 이모지)는 유니코드 표준에서 코드포인트라는 고유 번호를 부여받으며, 보통 'U+' 뒤에 16진수를 붙여 표기합니다(예: 'A'는 U+0041). 이 도구는 입력한 텍스트를 글자별로 분해해 각 글자의 코드포인트·10진수 값·유니코드 블록·가장 흔한 두 인코딩 방식의 바이트 표현을 보여주고, 코드값으로 문자를 역조회하는 기능도 제공합니다.

조회 방식

텍스트를 입력하면 이 도구는 글자 하나하나를 순회하며 자바스크립트의 유니코드 인식 문자열 메서드로 코드포인트를 읽고, 참조 표에서 그 코드포인트가 속한 유니코드 블록 이름(예: 'Basic Latin', 'CJK Unified Ideographs')을 찾습니다. 또한 UTF-8·UTF-16 인코딩의 원시 바이트와 동등한 HTML 숫자 문자 엔티티도 계산합니다. 역조회는 U+XXXX, 0x 16진수, 일반 10진수, 문자 1개 등 여러 형식으로 입력한 코드값을 받아 같은 정보를 보여줍니다.

자주 묻는 질문

UTF-8과 UTF-16 바이트는 뭐가 다른가요?
둘 다 같은 유니코드 코드포인트를 바이트로 인코딩하는 방식이지만, 바이트를 묶고 채우는 방식이 다릅니다. UTF-8은 글자당 1~4바이트를 사용하며 웹에서 가장 많이 쓰이는 인코딩이고, UTF-16(자바스크립트 문자열이 내부적으로 사용)은 글자당 2바이트 또는 4바이트를 사용합니다.
왜 어떤 글자는 문자 자체 대신 'Space', 'Tab', 'Control'로 표시되나요?
공백·탭·줄바꿈이나 코드포인트 32 미만의 다른 비인쇄 제어문자는 눈에 보이는 글자 모양이 없기 때문에, 셀을 비워두거나 보이지 않는 문자를 그대로 표시하는 대신 읽기 쉬운 라벨로 대체해 보여줍니다.
한 번에 분석할 수 있는 텍스트 길이에 제한이 있나요?
페이지 반응성을 위해 표는 분해 결과를 최대 1000자까지만 표시합니다. 입력한 텍스트가 더 길면 표시가 잘렸다는 안내가 나오지만, 요약 글자수와 바이트 크기는 전체 텍스트 기준으로 계산됩니다.