X$^3$-OPD: 온폴리시 정렬(On-Policy Alignment)을 통한 대규모 오디오-언어 모델로의 추론 능력 증류
요약
X³-OPD는 텍스트 교사 모델의 추론 능력을 오디오-언어 학생 모델로 전달하는 온폴리시 증류 프레임워크입니다. 음성 추론, 음향 장면 분석, 구어 대화 맥락을 포함하는 3단계 코퍼스를 통해 오디오 모델의 논리적 추론 능력을 향상시킵니다.
핵심 포인트
- 텍스트 교사 모델의 추론 능력을 오디오 모델로 전이하는 X³-OPD 제안
- 온폴리시 증류를 통해 학생 모델의 음향 인지 기반 추론 궤적 생성
- 음성, 음향 장면, 준언어적 단서를 포함하는 3단계 대칭 코퍼스 구축
- MMSU, MMAU 등 벤치마크에서 오디오 기반 사고 사슬(CoT) 품질 입증
대규모 오디오-언어 모델(Large Audio-Language Models)이 청각적 인지 분야에서 놀라운 발전을 이루었지만, 고품질 오디오 추론 데이터의 부족으로 인해 심층적인 논리 추론 측면에서는 여전히 텍스트 기반 대규모 언어 모델(Large Language Models)에 뒤처져 있습니다. 이러한 격차를 해소하기 위해, 우리는 강력한 텍스트 교사(Teacher) 모델로부터 오디오-언어 학생(Student) 모델로 추론 능력을 전달하는 교차 모달 온폴리시 증류(Cross-modal On-policy Distillation) 프레임워크인 X$^3$-OPD를 제안합니다. 학습 과정에서 학생 모델은 자신의 음향적 인지(Acoustic Perception)를 조건으로 추론 궤적(Reasoning Trajectories)을 생성하며, 교사 모델은 일치하는 텍스트 입력과 검증된 정답을 사용하여 토큰 수준(Token-level)의 가이드를 제공합니다. 우리는 더 나아가 음성으로 구현된 텍스트 추론, 복잡한 음향 장면(Acoustic Scenes)에 기반한 오디오 이벤트 추론, 그리고 준언어적 단서(Paralinguistic Cues)를 포함하는 구어 대화 추론을 아우르는 3단계 대칭 코퍼스(Three-tier Symmetric Corpus)를 구축합니다. 이러한 설계는 교차 모달 증류(Cross-modal Distillation)의 범위를 텍스트로 복구 가능한 콘텐츠를 넘어 비언어적 이벤트, 운율(Prosody), 그리고 대화 맥락에 기반한 추론으로 확장합니다. MMSU, MMAU, BIG Bench Audio 및 MMAR에 대한 실험 결과, X$^3$-OPD는 도메인 변화(Domain Shift) 상황에서도 모델의 기존 능력을 크게 유지하면서 오디오 기반 추론 및 사고 사슬(Chain-of-thought)의 품질을 실질적으로 향상시킨다는 것을 입증했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기