DONDO: 아프리카 언어를 위한 오픈 w2v-BERT 음성 인식(Speech-Recognition) 베이스 모델
요약
아프리카 27개 언어 변체를 지원하는 오픈 소스 음성 인식(ASR) 베이스 모델 제품군인 DONDO를 소개합니다. w2v-BERT 2.0을 기반으로 하며, 학습률 어닐링 미세 조정과 언어 조건화 메커니즘을 통해 높은 성능을 구현했습니다.
핵심 포인트
- 아프리카 27개 언어 대상 21개 단일 및 5개 다국어 모델 제공
- 학습률 어닐링(Learning-rate-annealing)을 통한 미세 조정 기법 적용
- 원-핫 언어 식별 주입을 통한 경량 언어 조건화 메커니즘 활용
- 평균 단어 오류율(WER) 10-13% 달성으로 높은 성능 확보
- Apache-2.0 라이선스로 상업적 이용 및 미세 조정 가능
우리는 w2v-BERT 2.0 자기지도 학습(self-supervised) 음성 인코더를 기반으로 구축된, 아프리카 언어를 위한 오픈 소스이자 허용 범위가 넓은 라이선스를 가진 자동 음성 인식 (ASR) 베이스 모델 제품군인 DONDO를 선보입니다. DONDO는 가나, 시에라리온, 나이지리아, 세네갈, 케냐, 짐바브웨 전역의 27개 언어 변체에 걸쳐 21개의 단일 언어(monolingual) 모델과 5개의 다국어(multilingual) 모델로 구성됩니다. 모델들은 주로 종교 텍스트에서 추출한 낭독 음성(read speech)을 통해 미세 조정(fine-tuning)되었으며, 이는 전사된 오디오(transcribed audio)가 부족한 언어들에 대해 광범위하고, 라이선스가 명확하며, 철자법이 일관된 범위를 제공합니다. 우리는 먼저 높은 학습률(learning rate)로 공유된 다국어 모델을 적응시킨 후, 이를 서서히 감소(anneal)시켜 강력한 단일 언어 베이스라인을 회복하거나 여러 경우에서 이를 능가하도록 하는 2단계(한 제품군의 경우 3단계) 학습률 어닐링(learning-rate-annealed) 미세 조정 절차를 설명합니다. 또한, 음향 특징(acoustic features) 앞에 접두사 프레임(prefix frames) 시퀀스로 원-핫 언어 식별(one-hot language identity)을 주입하는 경량 언어 조건화(language-conditioning) 메커니즘을 설명하며, 이를 통해 단일 다국어 체크포인트가 추론 시 타겟 언어로 유도될 수 있도록 합니다. 5개의 다국어 제품군 전반에 걸쳐, 어닐링된 모델들은 평균 단어 오류율 (WER) 10-13%에 도달하여, 단일 체크포인트로 많은 언어를 커버하면서도 단일 언어 모델과의 격차를 대부분 해소했습니다. 모든 모델은 다른 사용자들이 상업적 용도를 포함하여 자유롭게 미세 조정할 수 있도록 Apache-2.0 라이선스(기여 표시만 필요) 하에 Hugging Face KhayaAI 조직에 공개되었습니다. 우리는 커버된 언어들이 약 1억 명의 제1언어 화자에 의해 사용되며, 제2언어 사용을 포함할 경우 그보다 훨씬 더 많은 인구가 사용한다는 보수적인 추정치를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기