ReToken: 시각적 검색을 위한 시각-언어 모델(Vision-Language Models) 성능 향상을 위한 단일 토큰 방식
요약
ReToken은 긴 시각적 문맥을 처리할 때 발생하는 성능 저하와 메모리 문제를 해결하기 위해 제안된 단일 학습 가능 임베딩 방식입니다. 시각적 KV 캐시에서 쿼리와 관련된 희소한 토큰 세트를 검색하여 효율성을 높이며, 다양한 벤치마크에서 성능 향상을 입증했습니다.
핵심 포인트
- 시각적 KV 캐시에서 관련 토큰을 선택하는 단일 임베딩 방식 제안
- Qwen3VL-8B 및 InternVL3.5 등 주요 모델의 성능 대폭 향상
- 긴 비디오에 대한 제로샷 성능 개선 및 효율적인 추론 가능
- 단일 H100 GPU로 학습 및 긴 비디오 추론이 가능한 경량 설계
긴 시각적 문맥(Long visual context)은 시각-언어 모델(Vision-Language Models)에 도전 과제를 제기합니다. 방해 요소(distractors)의 수가 증가함에 따라 성능이 저하되며, GPU 메모리 제약 하에서 모든 토큰을 한꺼번에 처리하는 것은 계산적으로 불가능합니다. 우리는 미리 채워진 시각적 KV 캐시(visual KV cache)로부터 쿼리와 관련된 희소한 시각적 토큰(sparse set of query-relevant visual tokens) 세트를 선택하는, 명시적인 검색 대상(explicit retrieval target)으로 학습된 단일 학습 가능 임베딩(single learnable embedding)인 ReToken을 제시합니다. 작은 이미지-질의응답(image-QA) 데이터셋만으로 학습된 ReToken은 이미지 및 비디오 벤치마크 전반에서 일관된 이득을 제공합니다. Visual Haystacks에서 Qwen3VL-8B를 13.4포인트, InternVL3.5를 12.4포인트(상대적 >20%) 향상시켰으며, LVBench에서는 Qwen3VL-8B를 사용하여 긴 비디오에 대한 제로샷(zero-shot) 성능을 8.0포인트 향상시켰습니다. 경량화된 설계 덕분에 학습과 긴 비디오 추론(long-video inference) 모두 단일 H100에서 수행 가능합니다. 코드는 다음에서 확인할 수 있습니다: https://github.com/avaxiao/ReToken
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기