DirectSpeech2LLM: 음성-LLM의 프롬프트 과적합 완화를 위한 간단한 종단 간(End-to-End) 프레임워크
요약
본 논문은 음성 기반 대규모 언어 모델(LLMs)이 ASR 지침으로만 훈련될 때 발생하는 프롬프트 과적합 문제를 해결하기 위한 DirectSpeech2LLM이라는 종단 간 프레임워크를 제안합니다. 이 프레임워크는 거리 기반 CTC 손실과 그리디 레이블을 사용하여 LLM의 일반화 능력을 유지하며, ASR뿐만 아니라 음성 번역 및 감정 인식 같은 새로운 작업에서도 뛰어난 성능을 보여줍니다.
핵심 포인트
- DirectSpeech2LLM은 ASR 과적합 문제를 해결하는 End-to-End 프레임워크입니다.
- ASR 외의 새로운 지침(번역, 감정 인식)에도 제로샷으로 일반화됩니다.
- 거리 기반 CTC 손실을 사용하여 명시적인 회귀 손실 없이도 기하학적 접지를 제공합니다.
음성-LLMs는 종종 프롬프트 과적합(prompt overfitting)을 나타내는데, 이는 오직 자동 음성 인식(ASR) 지침으로만 훈련된 모델이 음성 번역과 같은 새로운 지침에 일반화하는 데 실패하고 주로 ASR 시스템처럼 행동한다는 것을 의미합니다. 우리는 DirectSpeech2LLM이라는 간단한 종단 간 프레임워크를 제안하며, 이는 음성을 조건으로 할 때 LLM의 지침 따르기 능력을 보지 못한 작업에서도 유지합니다. 이 프레임워크는 고정된(frozen) LLM 임베딩 행렬에 대해 거리 기반 CTC 손실(distance-based CTC loss)을 계산하고, 그리디 CTC 레이블(greedy CTC labels)을 사용하여 각각 기하학적 및 시간적으로 정렬된 음성 임베딩을 추출하여 LLM의 입력으로 사용합니다. 960시간의 LibriSpeech ASR 데이터만으로 훈련된 DirectSpeech2LLM은 ASR(보인 작업)에서 캐스케이드 시스템보다 성능이 우수하며, 음성 번역 및 감정 인식(두 개의 보지 못한 작업)에 대해 제로샷으로 일반화되어, 이 두 가지 새로운 지침을 훈련 중에 본 적이 없음에도 불구하고 캐스케이드 시스템의 상한선에 근접한 결과를 보여줍니다. 또한, 우리의 수정된 CTC 손실은 명시적인 회귀 손실(explicit regression loss)을 요구하지 않고도 충분한 암묵적 기하학적 접지(implicit geometric grounding)를 제공한다는 것을 보여주면서, 기하학적 정렬 강도가 이전에 가정했던 것보다 작은 역할을 한다는 것도 발견했습니다. 결과는 두 LLM 계열에 걸쳐 일관되며, 더 많은 훈련 데이터와 모델 용량 모두에 따라 확장됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기