평면적 언어 레이블에서 유형론적 사전 정보로: 다국어 음성-음성 번역을 위한 구조화된 언어 조건화 기술
요약
기존의 S2ST 시스템이 언어 정보를 단순한 평면 임베딩으로 처리하여 언어 간 구조적 관계를 놓치는 문제를 해결하기 위해 S2ST-Omni 2 프레임워크를 제안합니다. 이 모델은 유형론적 사전 정보를 활용하여 계층적 언어 인코딩, 동적 게이트 방식의 Dual-CTC, 유형론 인지 LLM 프롬프팅을 통해 다국어 적응 성능을 높였습니다. 실험 결과, 적은 양의 데이터로도 우수한 번역 성능을 보이며 데이터 효율적인 다국어 S2ST 가능성을 입증했습니다.
핵심 포인트
- 평면적 언어 레이블 대신 언어 간 체계적 구조를 반영하는 유형론적 사전 정보 활용
- 계층적 언어 인코딩, 동적 게이트 Dual-CTC, 유형론 인지 LLM 프롬프팅의 세 가지 수준에서의 최적화
- CVSS-C 실험 결과 BLEU, COMET 등 주요 지표에서 기존 S2ST 방식 대비 우수한 성능 달성
- 약 3시간의 적은 지도 학습 데이터만으로도 효과적인 다국어 적응 및 데이터 효율성 증명
음성 대규모 언어 모델 (SpeechLLMs)을 기반으로 구축된 구성적 음성-음성 번역 (Speech-to-Speech Translation, S2ST) 시스템은 최근 유망한 성능을 보여주고 있습니다. 그러나 기존의 S2ST 시스템은 소스 언어 (Source-language) 정보를 무시하거나, 각 소스 언어를 독립적인 평면 임베딩 (Flat embedding)으로 나타내는 언어-레이블 (Language-as-label) 패러다임을 통해 인코딩하는 경우가 많습니다. 이러한 설계는 언어 간에 공유되는 체계적인 언어 구조를 간과하며, 이는 지도 학습 기반의 S2ST 데이터가 부족할 때 데이터 효율적인 다국어 적응 (Multilingual adaptation)을 제한할 수 있습니다.
이 문제를 해결하기 위해, 우리는 다국어 언어 조건화 (Language conditioning)를 평면적 언어 레이블에서 구조화된 유형론적 사전 정보 (Typological priors)로 체계적으로 재구성하는 다대일 (Many-to-one) 구성적 S2ST 프레임워크인 S2ST-Omni 2를 제안합니다. 구체적으로, S2ST-Omni 2는 세 가지 수준에서 언어 조건화를 재검토합니다: 구조화된 소스 언어 표현을 위한 유형론 기반 계층적 언어 인코딩 (Typology-informed hierarchical language encoding), 콘텐츠 적응형 음향 변조 (Acoustic modulation)를 위한 동적 게이트 방식의 언어 인지 Dual-CTC (Dynamically-gated language-aware Dual-CTC), 그리고 디코더 측의 언어적 가이드를 위한 유형론 인지 LLM 프롬프팅 (Typology-aware LLM prompting)입니다.
CVSS-C에서의 실험 결과, S2ST-Omni 2는 채택된 평가 프로토콜 하에서 BLEU, COMET, ASR-BLEU, 그리고 BLASER 2.0 지표 모두에 대해 대표적인 S2ST 방식들 중 우수한 평균 성능을 달성했습니다. 절제 연구 (Ablation studies)는 제안된 표현 수준 (Representation-level), 음향 수준 (Acoustic-level), 그리고 디코딩 수준 (Decoding-level) 전략이 상호 보완적인 이점을 제공함을 보여줍니다. 또한, 통제된 데이터 예산 분석과 약 3시간의 지도 학습 데이터만을 사용한 일본어-영어 평가 결과는 명시적인 유형론적 사전 정보가 데이터 효율적인 다국어 S2ST를 위한 유용한 귀납적 편향 (Inductive biases)을 제공함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기