유니코드 문자 정보 조회기

문자 하나를 입력하면 코드포인트부터 바이트 구성까지 바로 확인할 수 있습니다.

코드포인트와 UTF-8 바이트는 왜 다른가요?

코드포인트(U+XXXX)는 유니코드 표준에서 그 문자에 부여한 고유 번호이고, UTF-8 바이트는 그 번호를 실제로 컴퓨터가 저장·전송할 때 몇 개의 바이트로 인코딩하는지를 보여줍니다. 영어 알파벳처럼 코드포인트 값이 작은 문자는 UTF-8에서 1바이트로 표현되지만, 한글 음절이나 이모지처럼 값이 큰 문자는 3~4바이트가 필요합니다. 텍스트 전체의 UTF-8 바이트 총량이 궁금하다면 텍스트 바이트 계산기를 이용해보세요.

한글 자모 단위 정보가 필요하다면

완성된 한글 음절이 아니라 초성·중성·종성 단위로 분리한 코드가 궁금하다면한글 자모 분리·결합기도 참고해보세요.

이럴 때 활용해보세요

프로그래밍 중 특정 문자의 코드를 찾아야 할 때, HTML 문서에 직접 입력하기 어려운 특수문자를 엔티티 코드로 표현해야 할 때, 또는 이모지나 특수기호가 왜 텍스트 길이 계산에서 예상과 다르게 잡히는지 확인하고 싶을 때 유용합니다.

자주 묻는 질문

이모지도 분석할 수 있나요?

네, 이모지처럼 코드포인트 값이 큰 문자도 분석할 수 있습니다. 다만 국기 이모지나 피부톤이 합성된 이모지처럼 여러 코드포인트가 결합된 경우, 이 도구는 결합된 첫 번째 코드포인트만 분석합니다.

유니코드 블록 정보는 정확한가요?

이 도구가 보여주는 블록 이름은 자주 쓰이는 대표적인 범위(한글 음절, 한글 자모, 영문, CJK 통합 한자, 이모지 등)를 간단히 구분해 보여주는 참고용 정보입니다. 유니코드 표준의 모든 세부 블록을 정밀하게 구분하지는 않습니다.