MEUSLI: LLM 기반 ASR 및 그 이상의 기능을 위한 다국어 프로젝터 (Multilingual Projector)
요약
MEUSLI는 Whisper 인코더와 오픈 소스 다국어 LLM을 연결하여 28개 유럽 언어를 지원하는 다국어 프로젝터 제품군입니다. ASR뿐만 아니라 음성 번역 및 주제 식별까지 가능한 확장성을 제공하며, 지속 학습을 통해 새로운 언어로의 확장이 용이합니다.
핵심 포인트
- 28개 유럽 언어를 지원하는 오픈 소스 다국어 프로젝터
- ASR을 넘어 음성 번역 및 주제 식별 기능 수행 가능
- 지속 학습 기술을 통한 미학습 언어로의 쉬운 확장성
- 고자원 및 저자원 언어 모두에서 강력한 성능 제공
경량 프로젝터 (Lightweight projectors)는 사전 학습된 음성 인코더 (speech encoders)를 대규모 언어 모델 (LLMs)과 연결하여, ASR (자동 음성 인식) 및 음성 질의응답 (spoken question answering)과 같은 작업을 위해 음향 특징 (acoustic features)을 토큰 수준의 임베딩 (token-level embeddings)으로 매핑하는 확립된 방법입니다. 그러나 기존 시스템은 일반적으로 몇 개의 언어만을 지원하며 영어로 제한되는 경우가 많습니다. 우리는 Whisper 인코더를 오픈 소스 다국어 LLM과 연결하여 28개의 유럽 언어에 대해 완전한 오픈 소스 엔드 투 엔드 (end-to-end) ASR을 가능하게 하는 최초의 오픈 사이언스 (open-science) 다국어 프로젝터 제품군인 MEUSLI를 소개합니다. MEUSLI는 이전의 단일 언어 파이프라인 (monolingual pipelines)을 확장하여, 고자원 (high-resource) 및 저자원 (low-resource) 언어 전반에 걸쳐 강력한 결과를 제공합니다. 적절한 지속 학습 (continual learning) 기술을 사용하면, MEUSLI는 학습 과정에서 보지 못한 다른 언어로 쉽게 확장될 수 있습니다. 우리는 더 나아가 MEUSLI 프로젝터가 ASR을 넘어 활용될 수 있음을 입증하였으며, 언어당 단 몇 시간의 작업 특화 감독 (task specific supervision)만으로 다국어 음성 번역 (multilingual speech translation) 및 주제 식별 (topic identification)을 가능하게 합니다. 전반적으로 MEUSLI는 확장 가능하고 포용적인 오픈 소스 SpeechLLM을 지원하며, 다국어 음성 이해 작업에 대한 견고한 기반을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기