EmoRES-TTS: 감성 음성 생성을 위한 잔차 강화 벡터 조향
요약
본 논문은 기존 감정 TTS 모델이 요청된 감정을 신뢰성 있게 표현하는 데 어려움이 있음을 지적하며, 트레이닝-프리 접근 방식인 벡터 조향을 연구합니다. 제안된 EmoRES는 감정 벡터를 공유 구성 요소와 잔차 구성 요소로 분해하여 백본 재학습 없이 두 요소를 제어함으로써 TTS의 감성 표현력을 크게 향상시켰습니다.
핵심 포인트
- EmoRES는 트레이닝-프리 방식으로 감성 TTS 성능을 개선합니다.
- 감정 벡터를 공유/잔차 구성 요소로 분해하는 것이 핵심입니다.
- IEMOCAP 데이터셋에서 CoCoEmo 대비 높은 성능 향상을 입증했습니다.
- 인간 평가에서도 자연스러움과 감지율 측면에서 우수함을 보였습니다.
감정 조건부 텍스트-음성 변환(TTS) 모델은 요청된 감정을 신뢰성 있게 표현하는 데 실패할 수 있으며, 추가적인 학습을 통한 제어 가능성 향상은 계산량과 감정 레이블링된 음성 훈련 데이터 모두에서 비용이 많이 듭니다. 따라서 우리는 고정된 모델의 내부 표현을 수정하는 트레이닝-프리(training-free) 접근 방식인 벡터 조향(vector steering)을 연구합니다. 기존의 감정 TTS를 위한 벡터 조향 방법인 CoCoEmo는 각 감정 벡터를 단일 전역 강도에 의해 제어되는 분할 불가능한 방향으로 취급하여, 요청된 감정에 대한 준수도를 제한합니다. 본 연구에서 우리는 먼저 감정 벡터가 중립적인 표현으로부터 음성을 이동시키는 공유 구성 요소(shared component)와 생성 과정을 요청된 감정 쪽으로 유도하는 잔차 구성 요소(residual component)로 분해될 수 있음을 발견했습니다. 이 발견을 바탕으로, 우리는 백본 재학습 없이 두 구성 요소를 제어하는 새로운 방법인 TTS를 위한 감정 잔차 강화 조향(Emotion Residual-Enhanced Steering for TTS, EmoRES)을 제안합니다. IEMOCAP 데이터셋에서 EmoRES는 IndexTTS-2 및 CosyVoice2 백본에 걸쳐 네 가지 목표 감정 지표 모두에서 CoCoEmo보다 우수한 성능을 보였습니다. 순위 상관관계(Rank correlation)는 각각 26.13%와 12.97% 포인트 향상되어 상대적 이득은 118.8% 및 33.1%에 해당하며, 감정 적중률(emotion hit rate)은 각각 12.95점과 6.92점 향상되어 상대적 이득은 20.1% 및 9.8%에 해당합니다. 인간 평가 결과는 청취자가 지배적인 요청된 감정을 올바르게 식별하는 비율에서 최대 35.0%의 상대적 개선, 그리고 충실도(fidelity)에서 최대 17.3%의 개선을 추가로 보여주었으며, 청취자들은 쌍별 비교 중 최대 63.8%에서 자연스러움 측면에서 EmoRES를 선호했습니다. 구성 요소 제거 실험(Component ablations)은 감정 조향 벡터의 잔차를 강화하는 동시에 공유 구성 요소를 보존하는 것이 효과적인 제어에 이점을 제공함을 추가로 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기