FineBench: 미세한 인간 행동 이해를 위한 시각-언어 모델 (VLM) 벤치마킹 및 강화
요약
FineBench는 긴 형식의 비디오에서 인간의 미세한 행동, 상호작용, 사물 조작을 정밀하게 이해하기 위해 설계된 새로운 VQA 벤치마크입니다. 연구 결과, GPT-5와 같은 폐쇄형 모델은 준수한 성능을 보였으나 오픈 소스 VLM은 복잡한 장면에서의 공간적/시간적 추론에 한계를 보였습니다. 이를 해결하기 위해 로컬라이저와 디스크립터를 활용하여 VLM의 성능을 높이는 모듈형 프레임워크인 FineAgent를 제안합니다.
핵심 포인트
- FineBench는 64개의 긴 비디오와 약 20만 개의 조밀한 QA 쌍으로 구성된 미세 행동 이해용 벤치마크입니다.
- 현재 오픈 소스 VLM은 다수 인원이 등장하는 장면의 공간적 추론과 미묘한 움직임 구별에 취약합니다.
- FineAgent는 로컬라이저와 디스크립터를 결합하여 VLM의 미세한 이해 능력을 강화하는 프레임워크입니다.
- FineAgent를 통해 다양한 오픈 소스 VLM의 FineBench 성능을 일관되게 향상시킬 수 있습니다.
시각-언어 모델 (Vision-Language Models, VLMs)은 일반적인 비디오 이해 분야에서 놀라운 능력을 보여주었으나, 인간의 행동과 상호작용에 대한 미묘한 해석을 요구하는 실제 응용 분야에서 필수적인 미세한 (fine-grained) 이해에는 종종 어려움을 겪습니다. 최근의 일부 인간 중심 벤치마크들은 공정성/윤리, 감정 인지 및 더 넓은 인간 중심 지표와 같은 모델 행동의 측면을 평가하고 있지만, 긴 형식의 비디오 (long-form videos), 매우 조밀한 질의응답 (QA) 범위, 그리고 대규모 프레임 수준의 공간적/시간적 그라운딩 (spatial/temporal grounding)을 결합하지는 못하고 있습니다. 이러한 격차를 해소하기 위해, 우리는 미세한 이해를 평가하기 위해 특별히 설계된 인간 중심 비디오 질의응답 (Video Question Answering, VQA) 벤치마크인 FineBench를 소개합니다. FineBench는 64개의 긴 형식 비디오 (각 15분)에 걸쳐 조밀하게 주석이 달린 199,420개의 객관식 QA 쌍으로 구성되며, 구성적 행동 (compositional actions)을 포함하여 상세한 사람의 움직임, 사람 간의 상호작용, 그리고 사물 조작에 초점을 맞춥니다. 우리의 광범위한 평가 결과, GPT-5와 같은 폐쇄형 모델 (proprietary models)은 준수한 성능을 달성하는 반면, 현재의 오픈 소스 VLMs는 다수의 인원이 등장하는 장면에서의 공간적 추론과 인간의 움직임 및 상호작용의 미묘한 차이를 구별하는 데 특히 어려움을 겪으며 성능이 현저히 떨어진다는 것을 보여줍니다. 이러한 식별된 약점을 해결하기 위해, 우리는 로컬라이저 (Localizer)와 디스크립터 (Descriptor)를 활용하여 VLMs를 강화하는 모듈형 프레임워크인 FineAgent를 제안합니다. 실험 결과, FineAgent는 FineBench에서 다양한 오픈 VLMs의 성능을 일관되게 향상시키는 것으로 나타났습니다. FineBench는 향후 미세한 인간 중심 비디오 이해 연구를 위한 엄격한 테스트베드를 제공하며, FineAgent는 현재 VLMs에서 이러한 추론을 강화하기 위한 실질적인 접근 방식을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기