2차 MLC-SLM 챌린지 제출: 화자 분리 및 ASR에 대한 캐스케이드 방식과 통합 방식 비교
요약
본 논문은 다국어 대화 음성 언어 모델(MLC-SLM) 챌린지에 제출된 HINTT 시스템을 소개합니다. 이 연구는 화자 속성 ASR 문제를 해결하기 위해, 기존의 캐스케이드 파이프라인 방식과 통합 음성 LLM 방식을 비교 분석했습니다. 실험 결과, 두 방식 모두 장단점을 보여주며 미래 방향성을 제시합니다.
핵심 포인트
- 다국어 화자 속성 ASR 문제를 다룸.
- 캐스케이드 파이프라인과 통합 음성 LLM을 비교함.
- 캐스케이드 시스템은 신뢰성이 높았음.
- 통합 음성 LLM은 미래 연구 방향으로 유망함을 제시.
본 논문은 2차 다국어 대화 음성 언어 모델(MLC-SLM) 챌린지에 제출된 HINTT 시스템을 제시합니다. 본 연구는 시스템이 누가 언제 말했는지, 그리고 무엇을 말했는지 결정해야 하는 다국어 화자 속성 ASR(speaker-attributed ASR) 문제를 다룹니다. 우리는 이 문제에 대한 두 가지 모델링 전략을 조사했습니다: 화자 분리(speaker diarization)를 음성-LLM 기반 ASR과 결합하는 캐스케이드 파이프라인, 그리고 화자 레이블, 타임스탬프 및 전사본을 직접 생성하는 통합 음성 LLM입니다. 우리의 최종 제출물은 미세 조정된 DiariZen 화자 분리 모델, 미세 조정된 Qwen3-ASR 모델, 그리고 LLM 기반의 생성 오류 수정으로 구성된 캐스케이드 파이프라인에 기반합니다. 비교를 위해, 동일한 공식 훈련 데이터를 사용하여 VibeVoice-ASR을 통합 모델로도 미세 조정했습니다. 모든 작업별 미세 조정 및 모델 선택은 외부 데이터나 유사 레이블 없이 오직 공식 MLC-SLM 데이터만을 사용했습니다. 실험 결과는 캐스케이드 시스템이 MLC-SLM Task 1 조건에서 더 신뢰성을 유지하는 반면, 통합 음성 LLM은 미래 화자 속성 ASR을 위한 유망한 방향을 제공함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기