Align, Integrate, 그리고 발화: 제로샷 음성 LLM을 위한 효율적인 토큰 수준 정렬
요약
본 논문은 제로샷 음성 처리를 위한 'Aligned Continuous Integrate-and-Fire' 프레임워크를 제시합니다. 이 방법은 동적 시간 변형(DTW) 정렬을 활용하여 연속적인 음향 프레임을 목표 텍스트의 이산 토큰 길이로 효율적으로 압축합니다. 이를 통해 계산 비용이 높은 LLM 순방향 통과 없이도 강력한 음성-의미론적 연결 고리를 구축하고, 메모리 효율적인 지식 증류를 통해 뛰어난 성능을 달성했습니다.
핵심 포인트
- 제로샷 음성 처리에 최적화된 'Aligned Continuous Integrate-and-Fire' 프레임워크 제안.
- DTW 정렬을 이용해 연속 음향 프레임을 이산 토큰 길이로 효율적으로 압축.
- LLM 순방향 통과를 우회하여 계산 비용을 획기적으로 절감함.
- 메모리 효율적인 지식 증류 목적 함수로 높은 성능 달성.
대규모 언어 모델(LLM)이 자연어 처리 분야에서 탁월한 성능을 보이지만, 이를 음성 입력으로 효율적으로 확장하는 것은 여전히 중요한 과제입니다. 기존의 SpeechLLM 구축 방법들은 종종 계산 비용이 많이 드는 전체 모델 미세 조정에 의존하거나, 비효율적인 토큰 시퀀스 길이와 높은 비용의 전체 모델 감독(supervision)으로 인해 어려움을 겪는 파라미터 효율적 프로젝터를 사용합니다. 본 논문에서는 제로샷 음성 처리를 위한 매우 효율적인 프레임워크인 Aligned Continuous Integrate-and-Fire를 소개합니다. 저희 방법은 명시적인 Dynamic Time Warping 정렬을 활용하여 연속적인 음향 프레임을 목표 텍스트의 정확한 이산 토큰 길이로 동적으로 압축합니다. 이를 통해 초기 학습 단계에서 계산 비용이 많이 드는 LLM 순방향(forward) 통과를 완전히 우회하면서, 가벼운 거리 측정 지표를 사용하여 견고한 음향-의미론적 연결 고리(acoustic-to-semantic bridge)를 구축할 수 있습니다. 후속 미세 조정 단계에서는 단일 LLM 레이어를 목표로 하는 메모리 효율적인 지식 증류(knowledge distillation) 목적 함수를 제안하며, 이는 전체 모델 크로스 엔트로피 학습과 경쟁하는 성능을 훨씬 적은 계산 비용으로 달성합니다. 자동 음성 인식(Automatic Speech Recognition) 및 음성 번역(Speech Translation)에 대한 광범위한 평가를 통해, 저희 방법이 이전의 파라미터 효율적 기준선들보다 우수한 성능을 달성함을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기