Whisper 모델의 제어된 미세 조정(Fine-Tuning)을 통한 강건한 아삼어 음성 인식
요약
자원이 부족한 아삼어의 음성 인식을 위해 Whisper 모델을 미세 조정(Fine-tuning)하는 연구를 제안합니다. 하드웨어 인지 최적화 파이프라인을 통해 성능을 크게 개선하였으며, 기존 Zero-shot 방식 대비 WER 및 CER 등 주요 지표에서 유의미한 향상을 달성했습니다.
핵심 포인트
- Mozilla Common Voice 데이터를 활용한 아삼어 ASR 시스템 구축
- T4 GPU 환경에 최적화된 혼합 정밀도 및 그래디언트 누적 학습 적용
- Zero-shot 베이스라인 대비 WER 78.26% 개선 달성
- 환각률(Hallucination rate) 96.70% 감소 및 실시간 계수 개선
아삼어(Assamese)와 같이 형태학적으로 풍부하고 자원이 부족한 언어를 위한 자동 음성 인식 (ASR) 기술을 개발하는 것은 주석이 달린 음성 데이터의 부족으로 인해 매우 어렵습니다. 사전 학습된 Whisper 모델은 아삼어 음성 인식 작업에서 낮은 성능을 보입니다. 본 논문은 Mozilla Common Voice 24.0-Assamese 코퍼스로 학습된, 제어된 미세 조정 (Fine-tuning) 기반의 Whisper 아삼어 ASR 시스템을 제시합니다. 자원이 제한된 환경을 위해 혼합 정밀도 학습 (Mixed-precision training) 및 그래디언트 누적 (Gradient accumulation)을 사용하여 Tesla 4 Graphics Processing Units (T4 GPUs)에서 실행되는 하드웨어 인지 최적화 학습 파이프라인을 구현하였습니다. 제안된 미세 조정 모델은 Zero-shot 베이스라인을 크게 능가하였으며, 단어 오류율 (WER) 43.17%, 음절 오류율 (CER) 13.18%, 일치 오류율 (MER) 43%, 단어 정보 손실 (WIL) 64.81%를 기록하여 베이스라인 대비 각각 78.26%, 93.10%, 57.0%, 35.19%의 유의미한 상대적 개선을 달성했습니다. 미세 조정된 모델의 의미론적 평가 또한 Zero 베이스라인 대비 눈에 띄는 개선을 보여주었으며, Bilingual Evaluation Understudy (BLEU) 점수 30.81, Metric for Evaluation of Translation with Explicit ORdering (METEOR) 점수 0.5262를 각각 기록했습니다. 또한, 예측된 환각률 (Hallucination rate)과 실시간 계수 (RTF)는 Zero-shot 베이스라인과 비교하여 각각 96.70% 및 32.38% 대폭 개선되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기