
TimeLens2
요약
TimeLens2는 비디오 내에서 특정 사건이 발생하는 시점을 예측하는 범용 비디오 시간적 접지(Video Temporal Grounding) MLLM입니다. 4B 및 8B 파라미터 모델로 구성되어 있으며, 7개의 벤치마크에서 397B 규모의 대형 모델을 능가하는 SOTA 성능을 달성했습니다.
핵심 포인트
- 비디오 내 근거 발생 시점을 예측하는 MLLM 모델
- 4B 및 8B 규모의 효율적인 모델 변형 제공
- 7개 벤치마크에서 SOTA(State-of-the-art) 달성
- 397B 파라미터급 대형 모델보다 뛰어난 성능 입증
TimeLens2
비디오 내에서 뒷받침하는 근거가 언제 발생하는지 예측하는 범용 비디오 시간적 접지 (Video Temporal Grounding) MLLM — 4B 및 8B 변형 모델로 7개의 벤치마크에서 SOTA를 달성하며, 397B 파라미터 모델들을 능가합니다. https://t.co/pmMa1Ap1Ge
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기