Unicode 18.0.0
요약
Unicode 18.0 초안은 문자 13,007개를 추가하여 총 172,808개의 문자를 수록하며, Proto-Cuneiform, Jurchen, Seal 등 새로운 대규모 표의문자 체계를 지원합니다. 또한 줄바꿈 규칙과 자소 클러스터 분할 동작을 개선하고, 변형 시퀀스 및 적합성 요구사항을 명확히 했습니다.
핵심 포인트
- 총 172,808개 문자로 확장되며, Proto-Cuneiform 등 신규 블록 추가
- Jurchen, Seal 등 대규모 표의문자 체계 지원으로 글꼴 설계에 과제 부여
- 줄바꿈 및 자소 클러스터 분할 규칙 개선으로 텍스트 처리 정확도 향상
- 변형 시퀀스 정의가 명확해지고 CJK 획용 등 표준화된 변형 추가
Unicode 18.0 초안은 문자 13,007개 를 추가해 총 172,808개를 수록하며, Proto-Cuneiform 숫자, Jurchen, Seal 문자 체계를 새로 지원함
줄바꿈과 자소 클러스터 분할 규칙이 바뀌며, 대시/하이픈 처리와 Balinese, Zanabazar Square, Bengali 텍스트의 분할 동작을 개선함
변형 선택자와 변형 시퀀스 의 적합성 요구사항을 명확히 하고, CJK 획과 수학 기호 등의 변형 시퀀스를 추가하며 Mongolian 시퀀스를 중국 표준과 동기화함
정렬, 식별자 보안, Unihan 데이터 변경은 기존 구현에 영향을 줄 수 있으며, CJK 범위를 하드코딩한 구현과 일부 데이터 파일 파서는 수정이 필요함
현재 페이지는 출시 예정 버전의 예비 초안 으로 세부 내용이나 링크가 부정확할 수 있으며, 베타 검토 기간의 마이그레이션 안내도 아직 미완성임
추가 문자와 새 블록
13,007개 문자 가 추가돼 전체 문자 수가 172,808개로 늘어남
새 문자 체계는 Proto-Cuneiform, Jurchen, Seal이며, Jurchen과 Seal은 대규모 표의문자 체계임
Proto-Cuneiform은 이번 버전에서 고대 숫자만 추가하며, 숫자가 아닌 기호는 향후 버전에서 인코딩될 것으로 예상됨
새 문자는 대부분 신규 블록에 들어가지만 기존 블록에도 추가됨
신규 블록은 다음과 같으며, 추가 문자와 주요 글리프 변경은 변경 코드 차트 에서 확인할 수 있음
11DF0..11DFF
: Bengali Supplement
12550..1268F
: Archaic Cuneiform Numerals
18E00..1919F
: Jurchen
191A0..191DF
: Jurchen Radicals
1D250..1D28F
: Musical Symbols Supplement
1DB00..1DBFF
: Miscellaneous Symbols and Arrows Extended
3D000..3FC3F
: Seal
Seal 은 블록 이름과 Script
속성값이며, 코드 차트 제목과 핵심 명세에서는 Small Seal 이라는 확장 명칭을 사용함
Archaic Cuneiform Numerals에는 매우 많은 숫자 문자 가 들어가며, 설형문자 전문 구현은 이를 고려해야 함
이 문자들은 서식 처리와 글꼴 설계에도 과제를 안겨줌
적합성 요구사항과 변형 시퀀스
변형 선택자와 변형 시퀀스 사용에 관한 정의와 적합성 요구사항을 갱신해, 이전 명세의 불명확한 문구를 명확히 함
표준화된 변형 시퀀스 에 CJK 획용 17개, 여러 수학 연산자와 스크립트 소문자 z용 10개를 추가함
Mongolian 변형 시퀀스를 대폭 수정해 중국의 Mongolian 표준과 동기화 함
관련 세부 사항은 UTN #57, “Encoding and Shaping of the Mongolian Script”에서 확인할 수 있음
문자 인코딩 안정성 정책 에 ID_Compat_Math_Start
와 ID_Compat_Math_Continue
의 새 속성 안정성 정책을 추가함
UTS #51 은 이모지/텍스트 표시 선택자와 기본 표시 방식 에 관한 지침을 갱신함
줄바꿈과 자소 클러스터 분할
UAX #14 의 LB12a 규칙은 BA
와 GL
사이의 줄바꿈을 금지하도록 바뀜
FIGURE DASH
와 EN DASH
의 Line_Break
값은 HH
에서 BA
로, SOFT HYPHEN
은 BA
에서 HH
로 변경함
앞선 텍스트와 NO-BREAK SPACE
로 구분된 EN DASH
에서 Unicode 5.1 이후 발생한 동작 회귀를 수정함
UAX #29 의 GB9c 는 인도계 결합 문자를 묶을 때 연결자 앞의 문맥을 요구하지 않도록 바뀌어 Balinese 자소 클러스터 분할을 개선함
Indic_Conjunct_Break
파생 방식 도 변경함
Unicode 17.0에서 발생한 Zanabazar Square 자소 클러스터 분할의 회귀를 수정함
Script
대신 Script_Extensions
를 사용하도록 바꿔 Bengali 분할 동작을 개선함
동아시아 문자 데이터와 Unihan 호환성
새 UAX #60 은 Seal, Jurchen, Nushu, Tangut 데이터 를 다룸
CJK Unified Ideographs Extension D 에 통합 한자 하나를 추가해 할당 범위의 끝을 U+2B81D
에서 U+2B81E
로 확장함
CJK 통합 한자 범위를 하드코딩한 구현은 갱신해야 함
UAX #38, Unihan 의 속성과 데이터 구문이 바뀜
잠정 속성 kJapaneseNewVariant
, kJapaneseOldVariant
를 추가하고 kIRGDaeJaweon
, kIRGKangXi
를 제거함
23개 속성의 구분자 와 kGB5
구문을 변경함
kIRG_GSource
의 구문과 설명, kIRG_KSource
, kIRG_UKSource
, kJinmeiyoKanji
, kOtherNumeric
, kTang
의 설명을 갱신함
부수/획수 색인 데이터 RSIndex.txt 는 세미콜론으로 구분하는 구문 으로 바뀜
식별자와 보안 처리
UAX #31 은 새 문자 체계를 식별자용 제외 문자 체계 목록 에 추가함
문자 체계 재분류의 주요 연락 창구는 Property and Algorithms Working Group(PAG)이며, UTC가 승인한 지침을 따름
UTS #39 는 Hntl
문자 체계 코드 를 지원하고 A1 규칙 을 강화함
ZWNJ
와 뒤따르는 연결 문자 사이에 Transparent
문자를 허용하던 예외를 제거함
A1 규칙을 사용하는 구현의 처리 결과가 바뀔 수 있음
confusables.txt
에서 NFD 형식에 나타나지 않아 혼동 문자 탐지 알고리듬이 사용하지 않던 데이터 를 다수 삭제함
공개 기여 중 일부를 반영해 데이터를 수정하고 추가했으며, 적어도 한쪽이 Identifier_Status=Allowed
인 혼동 문자 쌍에 중점을 둠
IdentifierType.txt
의 정렬 순서 가 값 집합별 그룹화에서 코드 포인트순으로 바뀜
Unicode 16.0에서 ScriptExtensions.txt
에 적용했던 변경과 유사함
정렬 알고리듬 변경
UTS #10 의 DUCET 를 Unicode 18.0.0 문자 집합에 맞춰 갱신함
Jurchen과 Seal은 암시적 가중치 를 사용하며, 새 기본 가중치를 추가하도록 암시적 가중치 알고리듬 을 소폭 수정해야 함
CLDR 루트 정렬 조정에 이미 있던 특수 매핑을 DUCET에도 추가함
Tibetan 축약 매핑 10개 를 추가해 DUCET의 올바른 형식을 충족함
U+FFFF 는 가장 높은 1차 가중치의 정렬 요소로 매핑함
U+FFFE 는 0이 아닌 가장 낮은 1차 가중치로 매핑하고, 코드 포인트 공간에서 정렬 키를 병합하기 위한 특수 처리를 적용함
이전부터 권장하지 않았던 Shift-Trimmed
옵션 을 UCA 명세에서 완전히 제거함
배포 파일과 코드 차트 변경
Index.txt
는 더 이상 갱신하지 않으며 , 18.0에 포함된 파일은 17.0과 동일함
이 파일은 폐기 대상으로, Unicode 19.0에서 완전히 제거할 예정임
수작업으로 관리하던 파일 기반 정적 색인은 이름 목록과 다른 UCD 데이터를 사용하는 문자 검색 도구 로 대체함
버전별 코드 차트 와 보조 차트, 차트 탐색 페이지를 /Public/18.0.0/charts/
아래로 모음
대표 글리프와 차트 글꼴 을 갱신함
Armenian과 Khitan Small Script 차트 글꼴을 각각 Noto Serif Armenian과 Khitan Small Linear로 변경함
U+06C4 ARABIC LETTER WAW WITH RING
글리프를 187-C13 에 따라 수정하고 여러 한자 글리프도 갱신함
두 이집트 상형문자 차트는 Unikemet.txt
의 기능/음성 정보를 포함하며, 18.0에서 추가로 갱신함
관련 렌더링 데이터도 변경함
UAX #50 은 U+1B168
의 vo=Tu
할당을 반영함
UAX #53 은 U+10EF4
, U+10EF6
, U+10EF9
를 MCM에 추가함
명세 확인과 마이그레이션 주의사항
이 페이지는 출시 예정 버전의 예비 초안 이므로 누락되거나 부정확한 내용, 잘못되거나 작동하지 않는 링크가 있을 수 있음
알파/베타 기간의 UAX와 UTS 링크는 개정안이 있으면 개정안을, 없으면 마지막 공개 버전을 가리킴
베타 UCD 초안에는 18.0의 전체 예정 문자 집합과 UTC가 승인한 데이터 변경을 포함함
마이그레이션 안내는 미완성 이며, 추가 영향은 베타 검토자를 위한 주요 쟁점 을 확인해야 함
표준은 핵심 명세, 코드 차트, 표준 부속서, UCD로 구성되며, HTML 핵심 명세 가 권위 있는 버전임
정렬, 보안, IDNA 호환 처리 , 이모지, URL/이메일 링크 탐지 의 5개 UTS를 18.0과 동기화 함
UTS #58은 이번 버전부터 Unicode와 버전을 동기화하며, 관련 데이터는 새 linkification
하위 디렉터리에 배포함
일부 변경은 구현 수정을 요구할 수 있으므로 각 명세의 마이그레이션 및 수정 내역을 확인해야 함
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기