
GigaAM Multilingual: 소외된 언어를 위한 오픈 소스 음성 파운데이션 모델 (speech foundation models)
요약
70개 이상의 언어와 200만 시간의 데이터를 학습한 오픈 소스 음성 파운데이션 모델 GigaAM Multilingual을 소개합니다. Conformer 인코더 구조를 사용하여 중앙아시아 언어에서 Whisper-large-v3보다 뛰어난 성능을 입증했습니다.
핵심 포인트
- 70개 이상의 다국어 지원 및 200만 시간 사전 학습
- 220M 및 600M 규모의 두 가지 Conformer 인코더 제공
- 중앙아시아 언어에서 Whisper-large-v3 대비 WER 32-86% 감소
GigaAM Multilingual: 소외된 언어를 위한 오픈 소스 음성 파운데이션 모델 (speech foundation models)
70개 이상의 언어에 걸쳐 200만 시간 동안 사전 학습된 두 개의 Conformer 인코더 (220M / 600M)는 중앙아시아 언어에서 Whisper-large-v3 대비 32–86%의 상대적 WER (Word Error Rate) 감소를 달성했습니다. https://t.co/UfeUcYRelb
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기