FastBench: 스트리밍 VLM이 고역동성 실세계 스트림을 인지할 수 있는가?
요약
본 기사는 기존 벤치마크가 놓치는 고역동성 실세계 비디오 스트림 인지 능력을 평가하기 위해 FastBench를 제안합니다. 이 트래젝토리 기반 파이프라인은 고프레임 클립에서 QA 생성을 결합하고, 다양한 시간적 범위(전방/즉시/후방)의 306개 QA 쌍을 포함합니다. 실험 결과, 현존 최고 모델인 Gemini-3.5-Flash도 스트리밍 이해에 한계가 있음을 보여주었습니다.
핵심 포인트
- FastBench는 고역동성 실세계 비디오 인지를 위한 새로운 테스트베드를 제공합니다.
- 모델들은 시간적 이력, 공간 해상도, 시간적 세분성을 동시에 유지하는 데 어려움을 겪습니다.
- ProactiveFrame은 희소 샘플링보다 우수하나, 여전히 오라클 기반 성능에는 미치지 못했습니다.
스트리밍 비디오 대규모 언어 모델(VLMs)은 연속적인 비디오 이해를 가능하게 하지만, 기존 벤치마크는 저역동성 시나리오에 초점을 맞추고 있습니다. 제한된 컨텍스트 예산 하에서, 모델들은 시간적 이력, 공간 해상도, 그리고 시간적 세분성을 균형 있게 유지해야 합니다. 1~2 FPS의 희소 샘플링은 빠른 이벤트를 놓치게 만듭니다. 저희는 실세계 비디오 스트림에서의 고역동성 인지를 평가하기 위해 FastBench를 소개합니다. 이 트래젝토리 기반 파이프라인은 고프레임(high-FPS) 클립에서 QA 생성을 결합하고, 2 FPS에서도 답변 가능한 질문을 필터링하며, SAM3 및 CoTracker3 트래젝토리를 사용한 답변 검증, 그리고 세 차례의 인간 검사를 거칩니다. FastBench는 인간이 주석 처리한 증거 구간과 함께 총 8개 도메인, 6가지 기능, 전방(forward), 즉시(instant), 후방(backward) 시간적 범위에 걸쳐 306개의 QA 쌍을 포함하고 있습니다. 또한, 저희는 텍스트 토큰을 통해 들어오는 프레임 속도를 조정하는 트레이닝이 필요 없는 기준선인 ProactiveFrame도 제시합니다. 이 이중계층 슬라이딩 윈도우는 최근의 고프레임 관찰 기록은 유지하면서 오래된 관찰 기록들을 희소한 역사로 다운샘플링합니다. 실험 결과, 상당한 한계점들이 드러났습니다: 가장 강력한 모델인 Gemini-3.5-Flash가 50.7% 점수에 그쳤습니다. 밀도 높은 샘플링은 Qwen3-VL-8B의 성능을 2 FPS에서 32.9%에서 24 FPS로 개선했지만, 역사가 압축됨에 따라 이득은 포화됩니다. ProactiveFrame은 희소 균일 샘플링보다 각각 5.4%, 1.5% 포인트 더 높은 성능을 보였지만, 여전히 오라클(oracle) 안내 기반의 집중력보다는 훨씬 낮았으며, 이는 현재 VLM들이 스트림만으로 언제 더 세밀한 시간적 인지가 필요한지 판단하는 데 어려움을 겪고 있음을 보여줍니다. FastBench는 고역동성 스트리밍 비디오 이해를 위한 테스트베드를 제공합니다. 코드와 데이터: https://github.com/Ashone3/FastBench.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기