Video-DeepResearch: 차세대 멀티모달 딥리서치 에이전트를 향하여
요약
비디오 스트림을 활용한 차세대 멀티모달 딥리서치 에이전트인 Video-DR을 제안합니다. 양식 편향과 파라미터 지식 누출 문제를 해결하기 위해 분리된 인지-탐색 파이프라인과 2단계 학습 레시피를 도입했습니다.
핵심 포인트
- 비디오 기반 시공간적 그라운딩을 통한 멀티모달 에이전트 확장
- 양식 편향 및 파라미터 지식 누출 문제 해결을 위한 새로운 파이프라인 제안
- SFT와 GRPO를 결합한 2단계 학습 레시피 채택
- Claude-4.5-Sonnet, GPT-5 등을 능가하는 SOTA 성능 달성
- 인간-AI 협업 벤치마크인 Video-DR-Bench 공개
우리는 멀티모달 에이전트(multimodal agents)를 정적 이미지에서 연속적인 비디오 스트림으로 확장하는 Video-DeepResearch (Video-DR)를 소개합니다. 이 설정은 오픈 웹 탐색(open-web exploration)과 결합된 밀도 높은 시공간적 그라운딩(spatiotemporal grounding)을 요구합니다. 예비 평가 결과, 현재 모델들에서 두 가지 결정적인 병목 현상이 드러났습니다: (1) 에이전트가 시각적 도구 대신 텍스트 검색을 선호하는 양식 편향(modality bias), (2) 모델이 진정한 도구 증강 실행(tool-augmented execution) 대신 내부 메모리에 의존하는 파라미터 지식 누출(parametric knowledge leakage)입니다. 이러한 과제를 해결하기 위해, 우리는 웹 검색 이전에 철저한 프레임 간 시각적 그라운딩(cross-frame visual grounding)을 강제하는 단계별 도구 잠금 해제(stage-wise tool unlocking) 기능이 포함된 분리된 인지-탐색 파이프라인(decoupled perception-exploration pipeline)을 특징으로 하는 Video-DR을 제안합니다. 우리의 프레임워크는 지도 미세 조정(supervised fine-tuning)에 이어 그룹 상대 정책 최적화 (GRPO, Group Relative Policy Optimization)를 따르는 2단계 학습 레시피를 채택하여, 모방 학습(imitation-learning)의 한계를 깨는 자율적 탐색을 가능하게 합니다. 또한, 우리는 200개의 복잡한 멀티홉 VQA(multi-hop VQA) 인스턴스로 구성된 인간-AI 협업 벤치마크인 Video-DR-Bench를 큐레이션했습니다. 실증적 결과에 따르면, 우리의 Video-DeepResearch-35B-A3B는 평균 정확도 64.0%로 새로운 SOTA(state-of-the-art)를 기록하며, 독점 모델인 Claude-4.5-Sonnet (59.0%)을 5.0포인트 차이로 앞질렀고, GPT-5 (52.5%) 및 Gemini 2.5 Pro (57.5%)를 크게 능가했습니다. 30B-A3B 변체는 59.3%를 달성하여 Claude-4.5-Sonnet과 경쟁할 만한 수준을 보여주었으며, 소규모 규모에서도 우리 학습 패러다임의 효과를 입증했습니다. 코드: https://github.com/Osilly/Vision-DeepResearch.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기