음성 함수 호출 (Spoken Function Calling): 대규모 오디오 언어 모델 (LALMs)을 위한 음성 언어 이해 (SLU)의
요약
본 연구는 대규모 오디오 언어 모델(LALMs)의 성능을 높이기 위해 새로운 의미 이해 관점인 '음성 함수 호출(Spoken Function Calling, SFC)'을 제안합니다. 기존 SLU의 한계를 넘어 오픈 도메인 작업에서 구조화된 규칙을 통해 의미 추출 정확도를 향상시키는 방법론을 다룹니다.
핵심 포인트
- 기존 SLU의 오픈 도메인 인컨텍스트 학습 한계 극복
- 구조화된 규칙 정의를 통한 음성 함수 호출(SFC) 개념 제안
- SFC-Bench 데이터셋 구축을 위한 멀티 에이전트 시스템 활용
- LALMs의 사후 학습을 통한 의미 추출 정확도 실질적 향상 입증
음성 언어 이해 (Spoken Language Understanding, SLU)는 작업 지향적 대화 시스템 (task-oriented dialogue systems)의 핵심 구성 요소이며, 원활한 인간-에이전트 상호작용을 달성하기 위한 중추적인 연결 고리입니다. 전통적인 SLU는 도메인 내 지도 미세 조정 (in-domain supervised fine-tuning) 이후 폐쇄형 집합 (closed-set) 작업을 위한 사용자 의미를 효과적으로 추출할 수 있지만, 모호한 규칙 정의로 인해 오픈 도메인 (open-domain) 작업을 위한 인컨텍스트 학습 (in-context learning)을 활용하는 데 상당한 어려움을 겪습니다. 본 연구는 전통적인 폐쇄형 SLU를 넘어 진화하기 위해, 구조화된 규칙 정의를 통해 의미 이해를 최적화하는 새로운 의미 이해 관점인 음성 함수 호출 (Spoken Function Calling, SFC)을 제안합니다. 구체적으로, 우리는 전통적인 SLU 데이터셋을 기반으로 음성 함수 제품군을 큐레이션 및 확장하고, SFC-Bench 데이터셋을 합성하기 위한 멀티 에이전트 시스템 (multi-agent system)을 구축하며, 대규모 언어 모델 (Large Language Models, LLMs) 및 대규모 오디오 언어 모델 (Large Audio Language Models, LALMs)의 성능을 평가하고, 사후 학습 (post-training)을 통해 LALMs의 SFC 능력을 향상시킵니다. 실험 결과, SFC는 전통적인 SLU보다 뛰어난 성능을 보였으며, LLMs 및 LALMs의 의미 추출 정확도를 실질적으로 향상시킴을 입증했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기