Gemini를 활용한 에이전트형 비디오 이해 기능 소개
요약
Gemini 3.7 Flash 등 최신 Gemini 모델에 에이전트형 비디오 이해 기능이 출시되었습니다. 이 기능은 네이티브 비디오 도구를 활용하여 비디오 분석의 정확도를 높이고, 토큰 사용량 및 비용을 대폭 절감합니다. 개발자는 이를 통해 장편 영상에서도 효율적이고 정밀한 비디오 처리가 가능해집니다.
핵심 포인트
- 에이전트형 비디오 이해 기능으로 정확도 향상 (최대 7%)
- 토큰 소비 최대 88% 절감, 분석 비용 최대 66% 절감
- 모델이 능동적으로 필요한 순간과 신호만 검색/검사하여 효율성 극대화
- Google AI Studio 및 Gemini Enterprise Agent Platform에서 사용 가능
Gemini를 활용한 에이전트형 비디오 이해 기능 소개

오늘, 저희는 최신 모델인 Gemini 3.7 Flash, 3.6 Flash 및 3.5 Flash-Lite에 걸쳐 에이전트형 비디오 이해 기능을 출시합니다. 이 새로운 기능은 정확도를 향상시키는 동시에 비디오 분석의 토큰 사용량과 비용을 대폭 절감합니다. 코드 실행을 Gemini 모델의 네이티브 이미지 이해와 결합하는 에이전트형 비전(agentic vision)과 유사하게, 에이전트형 비디오 이해는 Gemini의 네이티브 비디오 도구를 사용하여 성능을 개선하고 서브초 단위 순간 검색, 더 정확한 이상 감지, 정밀 계수 등 비디오 처리를 위한 새로운 기능을 활성화합니다.
이 기능은 Google AI Studio와 Gemini Enterprise Agent Platform에서 Gemini API를 통해 비디오 업로드 및 YouTube 동영상에 대해 오늘부터 이용 가능합니다.
벤치마크
현재의 '정적' 처리 방식(모델이 고정된 초당 프레임률로 비디오를 흡수하는 방식, 기본값은 1 FPS이며 API를 통해 조정 가능)과 달리, 에이전트형 비디오 이해는 모델의 핵심 추론 능력에 네이티브 비디오 도구를 결합하여 시각적 프레임, 오디오 및 스크립트를 가로질러 대상 비디오 세그먼트를 동적으로 검색, 스캔 및 검사합니다. 표준 비디오 분석 벤치마크 전반에 걸쳐, 에이전트형 비디오 이해를 갖춘 Gemini 모델은 분석 비용을 최대 66% 절감하고 토큰 소비는 최대 88% 절감하며, 정확도는 최대 7% 향상시킵니다.
이러한 효율성 증가는 특히 장편 비디오(10분짜리 사용 설명서부터 90분 강의 및 수시간 분량의 녹화본까지)에서 두드러지게 나타나는데, 정적 처리는 개발자가 높은 토큰 비용과 중요한 세부 정보를 누락시키는 기술 중 하나를 선택하도록 강요하기 때문입니다.
에이전트형 비디오 이해 기능을 활성화하면 Gemini 3.7 Flash의 경우 토큰 소비는 최대 88% 절감되고 정확도는 최대 7% 향상됩니다.

이러한 성능 향상은 지원되는 세 가지 모델 모두에 걸쳐 나타나지만, 에이전트형 이해 기능을 갖춘 Gemini 3.7 Flash는 전반적으로 최고의 품질을 제공하며, 품질과 비용 효율성의 최적 조합을 자랑하여 비디오 이해를 위한 테스트된 모델 중 정확도-비용 파레토 프론티어(pareto frontier)에 위치합니다.
에이전트형 비디오 이해 기능을 사용하면 Gemini 3.7 Flash가 비디오 분석의 정확도-비용 파레토 프론티어에 자리매김하게 됩니다.
작동 방식 (How it works)
모델이 고정된 프레임 속도로 미디어 스트림을 수동적으로 처리하는 대신, 에이전트형 비디오 이해 기능은 Gemini가 무엇을 볼지, 어느 속도로 볼지, 그리고 어떤 양식(프레임, 오디오 또는 스크립트)으로 볼지를 능동적이고 목표 지향적인 역할로 결정하게 합니다. 필요한 순간과 신호만을 가져오기 때문입니다. 개발자들은 이전에는 이러한 작업을 수동으로 수행해야 했지만, 에이전트형 비디오 이해 기능을 사용하면 Gemini가 내부 도구를 호출하여 관련 비디오 파일 부분을 로드함으로써 이를 달성할 수 있으며, 이는 개발 오버헤드를 크게 줄여줍니다.
기능 및 사용 사례 (Capabilities and use cases)
에이전트형 비디오 이해 기능은 다양한 까다로운 애플리케이션 전반에 걸쳐 개발자가 장편 비디오 콘텐츠를 처리하는 방식을 변화시킵니다.
서브초 단위 순간 검색: 1 FPS에서는 놓치기 쉬운 순간적인 상태 변화와 짧게 끊기는 경계(cut boundaries)를 정확하게 찾아내어 정밀한 자동 비디오 편집을 가능하게 합니다.장편 '건초 더미 속 바늘' 찾기 (Long-form needle-in-a-haystack search): 수 시간에 걸친 비디오 전체에서 복잡한 질의에 답할 수 있으며, 수백만 개의 토큰을 소비하지 않습니다.이상 감지 (Anomaly detection): 빠른 움직임이나 미묘한 시각적 아티팩트를 검사하기 위해 흥미로운 시간 구간을 더 높은 FPS로 리샘플링합니다.행동 및 객체 개수 세기: 시간이 지남에 따라 반복되는 물리적 움직임과 뚜렷한 객체를 정확하게 추적합니다.
토큰 효율적인 장편 비디오 분석
LongVideoBench라는 장편 비디오 이해 벤치마크에서 에이전트형 비디오 이해 기능 유무에 따른 Gemini 3.7 Flash의 성능을 확인해 보세요. 대폭 감소한 토큰 사용량과 향상된 정확도를 주목하세요.
동적 FPS를 활용한 정확하고 빠른 액션 분석
에이전트형 비디오 이해 기능을 통해 3.7 Flash는 필요에 따라 다양한 초당 프레임(FPS)으로 영상을 스캔하고 재시청함으로써 빠르게 진행되는 움직임을 정확하게 셀 수 있습니다.
토큰 효율적인 바늘 찾기 검색 (needle-in-a-haystack search)
에이전트형 비디오 이해 기능을 사용하면, Gemini 3.7은 정적 분석과 비교하여 훨씬 적은 토큰을 소모하면서도 비디오 콘텐츠를 기반으로 복잡한 질문에 정확하게 답변할 수 있습니다.
실제 사례 결과 (Real-world results)
많은 초기 액세스 파트너들이 에이전트형 비디오 이해 기능을 테스트하며 강력한 성능을 확인했습니다. 그들의 의견은 다음과 같습니다:




시작하기 (Getting started)
에이전트형 비디오 이해 기능은 Google AI Studio 및 Gemini Enterprise Agent Platform의 Gemini API를 통해 제공되며, Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 모델 전반에 걸쳐 출시됩니다. 추가 기능 비용 없이 표준 Gemini API 토큰 가격을 사용합니다.
활성화하려면 API 설정에서 단순히 처리 방식을
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기