MMAC: 오디오 캡셔닝 (Audio Captioning)을 위한 대규모 다차원 벤치마크
요약
오디오 캡셔닝 성능을 정밀하게 진단하기 위한 대규모 다차원 벤치마크인 MMAC을 제안합니다. 기존 방식의 한계를 넘어 정보 커버리지와 설명 신뢰성을 평가할 수 있는 15개 차원을 제공합니다.
핵심 포인트
- 오디오 캡셔닝을 위한 대규모 다차원 벤치마크 MMAC 제안
- 6개 능력 카테고리와 15개 평가 차원 포함
- 정보 커버리지 및 설명 신뢰성 중심의 평가 체계 구축
- 주요 AudioLLMs 모델들에 대한 성능 평가 수행
오디오 거대 언어 모델 (AudioLLMs)의 발전과 함께, 오디오 캡셔닝 (audio captioning)은 짧은 설명에서 벗어나 개방형의 세밀한 자유 형식 설명(free-form descriptions)으로 나아가야 합니다. 기존의 평가 방식은 주로 생성 품질이나 작업 성능에 집중되어 있어, 정보의 커버리지 (information coverage)와 설명의 신뢰성 (description reliability)을 진단하기 어렵습니다. 우리는 오디오 캡셔닝 (Audio Captioning)을 위한 대규모 다차원 벤치마크인 MMAC ( extbf{M}assive extbf{M}ulti-dimensional benchmark for extbf{A}udio extbf{C}aptioning)를 제안합니다. MMAC는 20개 이상의 데이터 소스에서 추출한 5,638개의 오디오 클립을 포함하며, 6개의 능력 카테고리와 15개의 평가 차원을 다룹니다. 모델이 생성한 캡션이 주어지면, MMAC는 해당 캡션이 목표 차원의 관련 정보를 언급하는지, 그리고 언급된 내용이 참조 라벨 (reference label)과 일치하는지를 확인합니다. 우리는 대표적인 오픈 소스 및 독점 AudioLLMs를 평가했습니다. 결과는 평가 차원, 정보 커버리지, 그리고 설명 신뢰성에 따라 뚜렷한 차이가 있음을 보여줍니다. 우리는 MMAC 벤치마크와 평가 코드를 공개할 예정입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기