유니코드

IT 위키

Unicode : 유니코드

세계 각국의 문자를 하나의 통일된 방법으로 표현하기 위해 만든 국제 문자 부호 규약.

  • 한 문자를 기본 16비트(2바이트)로 표현한다.
 16비트로 최대 65,536자를 코드화할 수 있다.
  • 확장 영역까지 합치면 백만 자 이상을 담을 수 있다.
  • 한글은 조합형·완성형·옛한글을 모두 표현할 수 있다.
  • 앞의 128자리는 ASCII 와 같은 순서로 배치해 호환성을 지켰다.

ASCII 를 32비트로 확장한 것이 아니다. 별도로 설계된 체계이며 기본 단위는 16비트다. 오류 검출이나 교정 기능도 없다. 그것은 해밍 코드나 패리티의 역할이다.

인코딩 방식

[편집 | 원본 편집]

유니코드는 '문자에 번호를 붙인 표' 이고, 그 번호를 바이트로 바꾸는 방식은 따로 있다.

방식 한 문자의 크기
UTF-8 1~4바이트 가변. 영문은 1바이트라 ASCII 와 그대로 호환된다. 웹 표준
UTF-16 2바이트 기본, 보조 평면은 4바이트
UTF-32 언제나 4바이트

한글 인코딩

[편집 | 원본 편집]
  • EUC-KR / CP949 : 완성형 한글. 유니코드 이전에 쓰던 국내 표준
  • UTF-8 : 한글 한 자가 3바이트다

같이 보기

[편집 | 원본 편집]