MUSE: 상황 기반 교육 환경에서 다중 모드 이해를 위한 대규모 비전-언어 모델 벤치마킹
요약
본 논문은 기존 벤치마크의 한계를 극복하고, 상황 기반 교육 환경에서 예술 이미지 이해를 평가하기 위한 새로운 벤치마크 MUSE를 제안합니다. MUSE는 시각적 지각부터 문화 이해 및 구성적 추론까지 포괄하는 12가지 작업을 포함하며, 다문화적 맥락을 반영한 다양한 예술 이미지를 제공합니다.
핵심 포인트
- MUSE는 교육 환경의 예술 이미지 이해에 초점을 맞춘 새로운 벤치마크입니다.
- 시각적 지각, 정서 해석, 문화 이해 등 포괄적인 능력을 평가할 수 있습니다.
- 다문화적 맥락과 서양 예술 전통을 아우르는 다양한 이미지를 제공합니다.
- 모델 간의 역량 격차를 분석하여 모델 개발의 과제를 제시합니다.
대규모 비전-언어 모델(large vision-language models)은 다중 모드 이해 분야에서 놀라운 발전을 이루었지만, 교육 환경에서의 역량 평가는 여전히 부족합니다. AI 지원 언어 학습에서 모델은 예술적 이미지를 해석하고, 그 의미적, 정서적, 문화적 내용을 이해하며, 시각적 맥락에 대해 추론하여 의미 있는 상호작용을 지원해야 합니다. 하지만 기존 벤치마크는 주로 실제 세계 이미지나 특정 도메인 교육 추론에 초점을 맞추고 있어, 예술 교육 콘텐츠에 대한 포괄적인 커버리지가 제한적입니다. 이러한 격차를 해소하기 위해, 우리는 상황 기반 교육 응용 분야에서 예술 이미지 이해를 평가하는 벤치마크인 MUSE를 소개합니다. MUSE는 이미지 주석과 질문 생성을 분리하여, 주석 노력을 줄이면서도 제어 가능한 난이도를 가진 다양한 작업을 가능하게 합니다. 이 벤치마크는 시각적 지각, 의미 및 정서 해석, 문화 이해, 구성적 추론을 아우르는 열두 가지 작업을 포함하며, 싱가포르와 동남아시아의 다문화적 맥락과 서양 예술 전통을 중심으로 여러 주제와 난이도를 포괄하도록 의도적으로 선별된 다양한 예술 이미지를 함께 제공합니다. 오픈 소스 및 독점 모델에 대한 평가는 특히 정서 해석 및 구성적 추론 영역에서 역량 차원의 상당한 격차를 드러냅니다. 또한, 우리의 분석은 교육을 위한 신뢰할 수 있는 다중 모드 모델 개발의 일반적인 실패 양상과 핵심 과제들을 식별합니다. 우리는 MUSE가 상황 기반 교육 응용 분야에서 다중 모드 이해 발전을 위한 표준화된 벤치마크 역할을 하기를 바랍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기