SomaliWeb v1: 일치하는 Tokenizer 및 공개 언어 식별(Language-Identification) 벤치마크를 포함한 품질
요약
SomaliWeb v1은 소말리어 전용 토크나이저와 언어 식별 벤치마크를 포함한 최초의 고품질 사전 학습 코퍼스입니다. 기존 다국어 데이터셋의 중복 문제와 글자 깨짐(Mojibake) 결함을 분석하고, GPT-4보다 효율적인 BPE-16K 토크나이저를 제안합니다.
핵심 포인트
- HPLT v2, CC100, Somali Wikipedia를 기반으로 한 약 303M 토큰 규모의 정제된 코퍼스 구축
- 기존 데이터셋에서 발견된 높은 중복률(17.3%) 및 글자 깨짐(56.1%) 문제 지적
- GPT-4의 cl100k_base 대비 토큰 생성량을 40.2% 절감하는 BPE-16K 토크나이저 공개
- 상용 언어 식별기 성능 비교를 위한 최초의 Somali 언어 식별 벤치마크 제공
Somali(소말리어)는 약 2,500만 명의 화자를 보유한 아프리카의 뿔(Horn of Africa) 지역의 쿠시어(Cushitic) 계열 언어이지만, 전용 Tokenizer(토크나이저) 및 언어 식별(Language-identification) 벤치마크를 갖춘 문서화된 Somali 사전 학습 코퍼스(Pretraining corpus)는 공개된 적이 없습니다. 기존의 Somali 텍스트는 다국어 데이터셋(HPLT v2, CC100, MADLAD-400, OSCAR, mC4) 내부에 포함되어 있거나, Hugging Face에 문서화되지 않은 소규모의 Somali 전용 업로드 형태로 존재합니다. 본 논문에서는 6단계의 재현 가능한 파이프라인(Pipeline)을 통해 세 가지 상위 소스(HPLT v2, CC100, Somali Wikipedia)로부터 구축된 819,322개의 문서(~303M tokens)로 구성된 품질 필터링된 Somali 코퍼스인 SomaliWeb v1을 소개합니다. 우리는 (i) 코퍼스, (ii) 일치하는 BPE-16K Tokenizer, (iii) 세 가지 상용 언어 식별기(Language identifiers)를 비교한 최초의 공개 Somali 벤치마크를 공개합니다. 우리의 측정 결과는 기존 데이터셋의 구체적인 품질 결함을 드러냅니다: HPLT v2의 "정제된(cleaned)" Somali 릴리스는 17.3%의 바이트 단위 동일 중복(Byte-exact duplicates)을 유지하고 있으며, 문서의 56.1%에 수정 가능한 모지바케(Mojibake, 글자 깨짐)가 포함되어 있고, 바이트 단위로 고유한 문서의 10.7%가 Jaccard tau=0.80 기준의 유사 중복(Near-duplicates)입니다. 토크나이저 수준의 측정 결과, 우리의 BPE-16K Tokenizer는 FLORES-200 Somali devtest에서 GPT-4의 cl100k_base보다 토큰을 40.2% 적게 생성합니다. 다운스트림 언어 모델의 Perplexity(혼란도) 비교는 후속 릴리스로 미룹니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기