【Google DeepMind】 영상 분석 비용 최대 66% 절감? Gemini의 'agentic video understanding' 정리
요약
Google DeepMind가 'agentic video understanding' 기능을 통해 긴 영상 분석의 효율성을 혁신합니다. 이 기능은 영상을 전체적으로 처리하는 대신 필요한 장면만 동적으로 검색하고 스캔하여 토큰 소비를 최대 88%, 비용을 최대 66% 절감하며 정확도를 향상시킵니다. Gemini Enterprise Agent Platform 및 API에서 사용할 수 있습니다.
핵심 포인트
- 필요한 장면만 선택적 분석으로 효율성 극대화
- 토큰 소비 최대 88% 감소, 비용 최대 66% 절감 효과
- Gemini 3.7 Flash와 결합 시 성능 최적화 확인
- API 및 Gemini 앱, YouTube 'Ask YouTube' 등 다양한 플랫폼에 적용 예정
긴 영상을 AI로 분석하게 되면 토큰(처리량)이 불어나고, 비용과 지연 시간도 커지는 경향이 있습니다. Google DeepMind가 2026년 9월 1일에 발표한 'agentic video understanding'은 영상을 처음부터 끝까지 일괄적으로 읽어들이는 방식을 버리고, 필요한 장면만 AI 스스로 선택하여 찾아보는 새로운 처리 방식입니다. Gemini Enterprise Agent Platform에서도 사용할 수 있습니다.
본 기사에서는 공식 블로그와 공식 문서를 바탕으로 그 원리, 효과, 사용 방법, 활용 기준을 정리합니다.
Google 공식 블로그에 따르면, agentic video understanding은 Gemini의 최신 모델에서 사용할 수 있는 신기능입니다. 영상의 토큰 소비를 최대 88%, 분석 비용을 최대 66% 절감하면서도 정확도를 최대 7% 향상시킨다고 합니다(Introducing agentic video understanding with Gemini | Google).
기존의 정적 처리 방식은 영상을 고정된 프레임 레이트(기본값: 초당 1프레임)로 가져와 영상 전체를 컨텍스트에 채워 넣는 방식이었습니다. 반면, agentic video understanding에서는 Gemini가 추론과 비디오용 도구를 결합하여 필요한 장면을 동적으로 검색하고 스캔하며 확인합니다. 차이점은 다음과 같습니다.
| 항목 | 정적 처리(기존) | agentic video understanding |
|---|---|---|
| 영상 가져오기 방식 | 고정된 프레임 레이트(기본 1FPS)로 전체를 가져옴 | 필요한 장면과 정보를 필요할 때 얻어옴 |
| ... | ||
| Gemini API의 비디오 이해 문서에 따르면, 정적 처리에서는 음성이 1Kbps(모노)로 처리되며 1초마다 타임스탬프가 붙습니다. 움직임이 빠른 장면은 1FPS 샘플링으로는 세부 정보가 손실될 수 있습니다(Video understanding | Gemini API | Google AI for Developers). |
제공 대상은 업로드한 영상과 YouTube 영상입니다. Gemini API의 Google AI Studio와 Gemini Enterprise Agent Platform 모두에서 이용할 수 있으며, 게다가 Gemini 앱에서도 곧 모든 사용자에게 전개될 예정이고, YouTube의 'Ask YouTube' 기능에도 몇 달 이내에 탑재될 예정이라고 합니다.
Google 공식 개발자 가이드에 따르면, agentic video understanding은 영상을 처음에 한 번에 읽어들이는 대신 서버 측 도구 루프(tool loop)로 작동합니다.
발표 당시 지원 모델 3가지 모두에서 효과가 나타난다고 하며, 그중에서도 Gemini 3.7 Flash에 agentic video understanding을 결합했을 때 정확도와 비용의 균형 면에서 가장 좋았음(정확도 대 비용의 파레토 프론티어)이 소개되었습니다. 블로그 그림에서는 Gemini 3.7 Flash로 장편 영상 이해를 측정하는 벤치마크(LongVideoBench) 결과가 제시되었으며, 토큰의 대폭적인 감소와 정확도의 향상이 확인됩니다.
다만, 이 수치는 '최대' 기준이며, 어디까지나 Google이 공개한 벤치마크상의 결과입니다. 실제 효과는 영상의 길이 또는 질문 내용에 따라 달라집니다.
공식 블로그에서는 agentic video understanding으로 가능해지는 용도로 다음 4가지가 언급되었습니다.
| 용도 | 내용 |
|---|---|
| 초(秒) 단위 장면 검색 | 1FPS로는 놓치기 쉬운 일순간의 상태 변화나, 샷 전환을 특정할 수 있습니다. 정밀한 자동 영상 편집 등에 활용 가능 |
| ... | |
| 수치화 예시로, 블로그에서는 Gemini 3.7 Flash가 빠른 움직임을 셀 때 프레임 레이트를 변경하며 영상을 다시 보는 모습이 소개되었습니다. |
Gemini Enterprise Agent Platform 문서에 따르면, agentic video understanding은 지원하는 모든 모델에서 **기본적으로 비활성화(정적 처리)**되어 있습니다(Video understanding | Gemini Enterprise Agent Platform | Google Cloud Documentation).
활성화하려면 영상 입력에 다음 파라미터를 설정해야 합니다. Agent Platform 릴리스 노트에 기재되어 있습니다(Gemini Enterprise Agent Platform release notes | Google Cloud Documentation).
| 사용 API | 설정 |
|---|---|
| Interactions API | 영상 입력에 processing: "agentic" 지정 |
| GenerateContent API | 영상 입력에 media_processing: "AGENTIC" 지정 |
공식 블로그에는 Gemini API를 사용한 샘플 코드가 게재되어 있습니다. YouTube 영상을 대상으로 한 예시로, 영상 입력에 `
| 출처 | 기재된 대응 모델 |
|---|---|
| 공식 블로그(발표 시) | Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite |
| ... | |
| 발표 시점의 Gemini API 변경 이력에서는 3.7 Flash, 3.5 Flash-Lite 세 모델에서 출시되었다고 기재되어 있습니다(Release notes | Gemini API |
Gemini API의 영상 이해 문서에서는 일반적인 기준으로 먼저 agentic 모드부터 시도할 것을 권장하고 있습니다. 특히, 응답 품질이나 토큰 효율을 최적화하고 싶을 때입니다. 그 위에 다음 케이스에서는 정적(static) 처리가 적합하다고 되어 있습니다.
| 영상・질문의 성격 | 적합한 방식 |
|---|---|
| 긴 영상 또는 특정 장면을 겨냥한 질문 (컨텍스트를 포함하지 않고, 관련된 정보만 얻고 싶을 때) | agentic video understanding |
| ... | |
| agentic video understanding에서는 생성이 시작되기 전에 내부 추론과 도구의 왕복(round trip)이 들어갑니다. 따라서 5분 미만의 짧은 클립에서는 첫 토큰이 반환될 때까지의 시간(TTFT: Time To First Token)이 약간 길어질 수 있습니다. 실제 영상과 질문으로 두 가지를 모두 시도하여 비교하는 것이 확실합니다. |
- agentic video understanding은 2026년 9월 1일에 발표된, Gemini가 영상의 필요한 장면만 골라 확인하는 새로운 처리 방식입니다.
- 기존의 고정 프레임률(fixed frame rate)로 가져오는 방식을 버리고, 'Think → Act → Observe' 루프를 통해 프레임・음성・자막을 필요에 따라 가져옵니다.
- 공식 블로그에서는 표준 벤치마크에서 토큰 소비가 최대 88%, 분석 비용이 최대 66% 절감되었으며, 정확도는 최대 7% 향상되었다고 합니다. 효과는 특히 긴 영상에서 크며, 88%와 7%는 Gemini 3.7 Flash에서의 수치입니다.
- Gemini Enterprise Agent Platform에서는 기본적으로 비활성화되어 있습니다. Interactions API에서는 `processing:
본 기사는 2026년 9월 기준의 공식 정보를 바탕으로 정리되었습니다. 기능 지원 모델이나 설정은 변경될 수 있습니다. 실제 이용을 검토하실 때는 최신 공식 정보를 확인해 주십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기