음성 언어 모델 조향: 대비 활성화 추가를 통한 학습 없는 태스크 특화
요약
본 논문은 음성 언어 모델(SpeechLLMs)에 대한 학습 없는 태스크 특화 기법으로 '대비 활성화 추가(CAA)' 프로토콜을 제안합니다. 이 방법은 소수의 발화 레이블만으로 일반적인 음성 태스크를 위한 조향 벡터를 도출하며, 이를 추론 시 표현 공간에 추가하여 성능 향상을 입증했습니다.
핵심 포인트
- SpeechLLMs의 행동 제어를 위한 새로운 학습 없는 접근 방식(CAA)을 제시함.
- 소수의 레이블링된 발화만으로 일반 음성 태스크 특화 벡터를 도출 가능.
- 프롬프팅과 결합 시 ASR, ER 등 다양한 태스크에서 일관된 성능 개선을 보임.
- 도메인 외부 데이터로의 전이성과 스크립트 정규화 방향의 유용성을 입증함.
활성화 조향(Activation steering)은 추론 시간(inference time)에 대규모 언어 모델(LLMs)의 행동을 제어하는 데 효과적임이 입증되었지만, 이를 음성 언어 모델(SpeechLLMs)에 적용한 사례는 아직 새롭고, 이러한 모델에 대한 학습 없는 조향 접근 방식은 여전히 크게 탐구되지 않은 영역입니다. 본 논문에서는 소수의 레이블링된 발화(labeled utterances)로부터 일반적인 음성 태스크(예: 전사(transcription))를 위한 조향 벡터를 SpeechLLMs에서 도출하는 학습 없는 대비 활성화 추가(Contrastive Activation Addition, CAA) 프로토콜을 제안합니다. 우리는 이러한 벡터들을 추론 시간의 표현 공간(representation space)에 추가하는 것이 목표 음성 태스크를 더 잘 강제한다는 것을 보여줍니다. 나아가, 프롬프팅과 결합했을 때, 이 벡터들은 자동 음성 인식(Automatic Speech Recognition, ASR)이나 감정 인식(Emotion Recognition, ER)과 같은 대부분 평가된 태스크에서 프롬프팅만 사용했을 때보다 일관된 개선을 가져오며, 도메인 외부 데이터로 전이됨을 보여줍니다. 또한 특정 언어의 목표 스크립트를 강제하는 데 있어 스크립트 정규화 방향(script-normalization directions)의 유용성을 추가적으로 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기