Mega-ASR: 실제 환경의 복합적 음향 시뮬레이션 확장을 통한 야생(In-the-wild^2) 음성 인식 연구
요약
Mega-ASR은 실제 환경의 복합적인 음향 왜곡 상황에서도 견고한 음성 인식을 수행하기 위해 제안된 통합 프레임워크입니다. 54가지 복합 시나리오를 포함하는 Voices-in-the-Wild-2M 데이터셋과 점진적 음향-의미 최적화 학습 방식을 통해, 기존 모델들이 겪는 음향적 강건성 병목 현상을 해결합니다. 실험 결과, 열악한 환경의 벤치마크에서 기존 SOTA 시스템 대비 월등한 성능과 30% 이상의 WER 감소를 입증했습니다.
핵심 포인트
- 실제 환경의 복합적 음향 왜곡을 모사하는 Voices-in-the-Wild-2M 데이터셋 도입
- 음향-의미 점진적 지도 미세 조정(Acoustic-to-Semantic Progressive Supervised Fine-Tuning) 기법 적용
- 이중 입도 WER 게이트 정책 최적화를 통한 학습 효율성 증대
- 복잡한 음향 시나리오에서 기존 베이스라인 대비 30% 이상의 상대적 WER 감소 달성
자동 음성 인식 (ASR) 및 대규모 오디오-언어 모델 (Large Audio-Language Models)의 급격한 발전에도 불구하고, 실제 환경에서의 견고한 인식은 "음향적 강건성 병목 현상 (Acoustic Robustness Bottleneck)"으로 인해 여전히 제한적입니다. 즉, 모델은 심각하고 복합적인 왜곡 상황에서 음향적 근거 (Acoustic Grounding)를 상실하고 누락이나 환각 (Hallucination)을 생성하는 경우가 많습니다. 우리는 확장 가능한 복합 데이터 구축과 점진적인 음향-의미 최적화 (Acoustic-to-Semantic Optimization)를 결합한 통합된 야생 음성 인식 (ASR-in-the-wild) 프레임워크인 Mega-ASR을 제안합니다. 우리는 7가지 고전적 음향 현상과 54가지 물리적으로 타당한 복합 시나리오를 포함하는 Voices-in-the-Wild-2M을 도입하며, 음향-의미 점진적 지도 미세 조정 (Acoustic-to-Semantic Progressive Supervised Fine-Tuning) 및 이중 입도 WER 게이트 정책 최적화 (Dual-Granularity WER-Gated Policy Optimization)를 통해 Mega-ASR을 학습시킵니다. 광범위한 실험을 통해 Mega-ASR이 열악한 조건의 ASR 벤치마크에서 기존의 최첨단 (State-of-the-art) 시스템보다 상당한 우위를 점함을 입증했습니다 (VOiCES R4-B-F에서 45.69% 대 54.01%, NOIZEUS Sta-0에서 21.49% 대 29.34%). 복잡한 복합 음향 시나리오에서 Mega-ASR은 강력한 오픈 소스 및 폐쇄형 소스 베이스라인 대비 30% 이상의 상대적 단어 오류율 (WER) 감소를 달성하였으며, 이를 통해 야생 환경에서의 견고한 ASR을 위한 확장 가능한 패러다임을 구축했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기