프레임 사이의 의미 읽기: 소셜 미디어 영상의 암시적 및 비언어적 의미 해석
요약
소셜 미디어 영상의 암시적, 비언어적 의미를 해석하는 능력을 평가하기 위한 새로운 벤치마크인 DrivelHub+를 소개합니다. 기존의 단순 묘사 중심 작업에서 벗어나, 영상의 화용론적 맥락과 수사적 의미를 추론하는 모델의 능력을 측정합니다.
핵심 포인트
- 소셜 미디어 영상의 맥락적 멀티모달 추론을 위한 DrivelHub+ 벤치마크 제안
- 1,000개의 영상과 사람이 작성한 암시적 서사 주석 포함
- 모델의 화용론적 이해를 설명(Explanation)과 표현(Representation) 관점에서 평가
- 단순 인식을 넘어 영상의 숨겨진 의도를 파악하는 능력 측정
소셜 미디어 영상은 종종 눈에 보이는 행동, 캡션 또는 음성을 넘어선 의미를 전달합니다. 평범한 클립도 멀티모달 (multimodal) 단서와 문화적 맥락의 상호작용을 통해 유머러스하거나, 반어적이거나, 풍자적으로 변할 수 있으며, 이는 이러한 콘텐츠를 비디오-언어 모델 (video-language models)에게 어려운 테스트 케이스로 만듭니다. 본 논문에서는 모델이 겉보기에는 무의미해 보이지만 의도적인 화용론적 (pragmatic) 의미를 전달하는 소셜 미디어 영상의 암시적, 비선형적, 수사학적으로 층위가 있는 의미를 추론할 수 있는지 평가하기 위한 벤치마크인 \textit{DrivelHub+}를 소개합니다. DrivelHub+는 소셜 미디어에서 수집된 1,000개의 영상으로 구성되며, 각 영상에는 사람이 작성한 암시적 서사 설명이 주석으로 달려 있습니다. 인식이나 묘사에 초점을 맞춘 기존의 비디오 이해 작업과 달리, 우리는 맥락적 멀티모달 추론 (contextual multimodal reasoning)을 목표로 하는 벤치마크를 제시합니다. 우리는 두 가지 관점에서 현재의 비디오-언어 모델을 평가합니다: 첫째는 설명 (explanation)으로, 모델이 영상의 화용론적 이해를 자연어로 설명해야 합니다. 둘째는 표현 (representation)으로, 비디오-텍스트 (video-to-text) 및 텍스트-비디오 (text-to-video) 검색 모두에서 모델의 표현이 영상을 해당 암시적 서사와 일치시키는지 테스트하기 위해 추론-을-검색-으로 (reasoning-as-retrieval) 방식을 적용합니다. 우리의 벤치마크는 멀티모달 지각 (multimodal perception)과 화용론적 이해 (pragmatic comprehension) 사이의 격차를 측정하기 위한 진단적 설정을 제공하며, 현재의 모델이 보여지는 것을 묘사하는 것을 넘어 의미하는 바를 추론할 수 있는지 질문합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기