SepRQ: 마스크 없는 다중 스케일 소스 분리 기반의 자기 지도 음성 혼합 표현 학습
요약
SepRQ는 기존 단일 화자 중심의 자기 지도 음성 표현 학습(SSL) 모델의 한계를 극복하기 위해 개발된 오픈소스 프레임워크입니다. 이 프레임워크는 마스크 예측 대신 가짜 소스 분리 목표를 사용하여 다중 스케일, 마스크 없는 접근 방식을 채택했습니다. 그 결과, 화자 디아리제이션 및 음성 분리 분야에서 최첨단 성능을 달성하며 강력한 범용성을 입증했습니다.
핵심 포인트
- 마스크 예측 대신 가짜 소스 분리를 목표로 하는 새로운 SSL 프레임워크 제시
- 다중 스케일, 마스크 없는 접근 방식으로 SUPERB 벤치마크 최고 성능 달성
- 화자 디아리제이션 및 음성 분리 분야에서 강력한 범용성과 성능 입증
- 오픈소스 공개를 통해 커뮤니티의 연구 발전에 기여
자기 지도 학습(SSL)은 음성 표현 학습에 표준으로 사용되지만, 주류 모델들은 단일 화자 오디오를 중심으로 설계되어 다중 화자 시나리오에서의 유용성이 제한적입니다. 우리는 마스크 예측을 고정된 랜덤 투영 코드북(random-projection codebooks) 기반의 가짜 소스 분리 목표(pseudo-source-separation objective)로 대체하는 오픈소스 SSL 프레임워크인 SepRQ를 제시합니다. 새로운 마스크 없는 다중 해상도 접근 방식을 채택함으로써, SepRQ는 SUPERB 벤치마크에서 화자 디아리제이션(Speaker Diarization) 및 음성 분리(Speech Separation) 분야에서 최첨단 성능을 달성하며, Base 규모와 Large 규모 모두에서 WavLM 및 기타 칵테일 파티 기반 SSL을 능가합니다. 또한, 단지 85.68M의 추론 매개변수만을 필요로 합니다. SepRQ는 등록(enrollment)이 필요한 대상 화자 작업(예: Target-Speaker Automatic Speech Recognition)과 까다로운 다중 도메인 DIHARD 3 디아리제이션 데이터셋 전반에 걸쳐 강력한 성능을 보여줍니다. 특히, 현재 SSL 문헌에서 어려움을 겪는 세 화자 혼합물(WSJ0-3Mix)에서도 강력한 분리 능력을 보고합니다. 칵테일 파티 기반 SSL은 여전히 부족하고 비공개이며 C-HuBERT와 등록 기반 SA-WavLM으로 제한되어 있지만, 우리는 SepRQ를 커뮤니티에 오픈소스화합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기