Google, 지시 기반 비디오 편집 및 생성을 위해 Google Vids에 Gemini Omni 도입
요약
Google이 Google Vids에 Gemini Omni를 도입하여 텍스트와 이미지 기반의 엔드 투 엔드 비디오 생성 및 편집 기능을 강화했습니다. 사용자는 대화형 인터페이스를 통해 기존 영상의 배경을 바꾸거나 조명을 조절하는 등 정교한 편집을 수행할 수 있습니다.
핵심 포인트
- Gemini Omni의 멀티모달 능력을 활용한 대화형 비디오 편집 레이어 도입
- 텍스트 프롬프트 및 이미지 참조를 통한 새로운 비디오 클립 생성 지원
- 물리 법칙 추론 및 현실 세계 이해를 통한 시각적 일관성 확보
- 기존 푸티지의 특정 요소(배경, 조명 등)만 선택적으로 수정 가능
Google은 엔드 투 엔드 (end-to-end) AI 비디오 생성 및 편집을 위해 Gemini Omni를 Google Vids로 확장했습니다. 이번 업데이트를 통해 사용자는 텍스트와 이미지 참조를 통해 클립을 생성할 수 있으며, 단계별 대화를 통해 기존 푸티지 (footage)에 타겟팅된 변경을 수행할 수 있습니다. 사용자는 매번 수정을 거칠 때마다 비디오를 새로 만드는 대신, 조정을 설명하고 유용한 경우 추가 미디어를 제공하여 그 자리에서 결과를 개선할 수 있습니다.
핵심적인 발전은 Vids 워크플로 (workflow) 내에서 Omni의 멀티모달 (multimodal) 및 현실 세계 이해 능력의 활용입니다. Google DeepMind의 Gemini Omni 개요에 따르면, 이 모델은 이미지, 텍스트, 비디오 및 오디오를 포함한 임의의 미디어를 기반으로 작동할 수 있으며, 세상에 대한 지식과 물리 법칙과 유사한 추론에 기반한 참조-비디오 (reference-to-video) 기능을 적용할 수 있습니다. Google Vids에서 이러한 기반은 생성 및 편집된 장면이 구성, 문맥 및 시각적 동작 측면에서 더욱 일관성을 갖도록 하는 것을 목표로 합니다.
아이디어 전달, 교육 자료 또는 내부 업데이트를 위해 이미 Vids를 사용 중인 팀의 경우, 이번 변화는 AI 지원을 초안 생성 단계 그 이상으로 확장시킵니다. 이는 전체적인 장면과 워크플로를 유지하면서 비디오의 선택된 부분을 변경할 수 있는 대화형 편집 레이어 (conversational editing layer)를 도입합니다.
Gemini Omni가 Google Vids에서 변화시키는 것
Gemini Omni는 비디오 생성과 수정 모두를 지원합니다. 크리에이터는 프롬프트 (prompt) 또는 이미지 참조로 시작하여 클립을 생성하거나, 기존 푸티지를 가져와 무엇을 변경해야 하는지 지정할 수 있습니다. Google은 컬러 그레이딩 (color grading) 또는 조명 변경, 배경 교체, 배경 요소 제거와 같은 예시를 설명합니다.
이러한 구분은 프롬프트 기반 비디오 생성 (prompt-to-video)과 비디오 편집 (video editing)이 서로 다른 실질적인 제약 조건을 갖기 때문에 중요합니다. 새로운 클립을 생성하는 것은 영상 소스가 존재하지 않을 때 유용할 수 있습니다. 반면, 기존 자료를 편집하는 것은 팀이 확립된 피사체, 장면 또는 메시지를 유지하면서 선택된 세부 사항만 변경하고자 할 때 더 적합합니다. Omni의 참조 처리 (reference handling) 기능은 각 요청을 개별적인 출력물로 취급하기보다, 이러한 모드들을 서로 연결하도록 설계되었습니다.
| 워크플로우 (Workflow) | Vids에서 Gemini Omni가 사용되는 방식 | 지원되는 입력 또는 지시 사항 |
|---|---|---|
| 새로운 클립 생성 | 프롬프트와 이미지 참조를 통해 비디오 콘텐츠 생성 | 텍스트 프롬프트 및 이미지 참조 |
| ... |
모델이 명시한 현실 세계 기반 지식 (real-world grounding)은 시각적 불일치를 드러낼 수 있는 편집 작업에서 특히 유용합니다. 조명을 변경하거나, 배경을 교체하거나, 피사체를 변형해 달라는 요청은 시스템이 주변 장면을 고려할 것을 요구합니다. Google은 Omni의 세상에 대한 이해 (world understanding)와 물리 법칙과 유사한 추론 (physics-like reasoning) 능력을 이러한 변환 과정 전반에서 사실감과 일관성을 향상시키는 메커니즘으로 제시합니다.
기능 세트에는 AI가 생성한 클립에 등장할 수 있는 **선택 사항인 개인 아바타 (optional personal avatars)**도 포함되어 있습니다. 이는 사용자가 새로 촬영한 영상에만 전적으로 의존하지 않고 비디오 프레젠테이션을 만들 수 있는 또 다른 방법을 제공하지만, Google은 아바타를 편집 워크플로우의 필수 사항이 아닌 선택 사항으로 규정하고 있습니다.
기반이 되는 Vids 경험은 AI 비디오 워크플로우에 대해 Google의 Veo 기반 접근 방식을 지속하고 있지만, Omni는 더 광범위한 참조 기반 비디오 생성 (reference-to-video) 및 대화형 편집 (conversational editing) 기능을 추가합니다. 실질적인 변화는 단순히 Vids가 더 많은 비디오를 만들 수 있다는 점이 아닙니다. 제작자가 제작 과정 중에 지시 사항과 문맥적 소스 자료를 사용하여 모델을 점진적으로 디렉팅할 수 있다는 점입니다.
가용성, 추적 가능성 및 워크플로우에 미치는 영향
Google은 2026년 7월 중순에 Omni 기능이 활성화된 Vids 기능을 공개적으로 출시했습니다. 회사는 여러 Google Workspace 티어(tier) 및 소비자 요금제에 걸쳐 가용성을 설명하고 있으나, 제공된 자료에는 요금제별 상세 권한이나 가격 세부 정보가 모두 포함되어 있지 않습니다. 따라서 조직은 해당 기능을 중심으로 워크플로우(workflow)를 설계하기 전에 자체 Workspace 또는 소비자 요금제의 액세스 권한을 확인해야 합니다.
지역적 조건 또한 중요합니다. Google의 출시 정보에 따르면, 출시 시점에 유럽 경제 지역(EEA), 영국, 텍사스 및 일리노이에서는 Omni를 사용한 비(non)-AI 편집에 대한 제한 사항이 식별되었습니다. 이는 조직이 Google Vids에 액세스할 수 있는 상황이라 하더라도, 모든 관할 구역에서 가용성이 균일하다고 간주해서는 안 된다는 것을 의미합니다.
또한 Google은 생성 및 편집 워크플로우에 **SynthID 워터마킹 및 추적 가능성 (traceability)**을 포함하고 있습니다. SynthID는 AI 출처 (provenance)를 검증하는 데 도움을 주기 위한 것으로, 생성되었거나 실질적으로 편집된 미디어를 기존의 일반 영상과 구분해야 하는 조직에게 매우 중요합니다. 이는 조직의 검토, 승인 또는 공개 프로세스를 대체하는 것은 아니지만, 투명성 노력과 일치하는 기술적 계층을 제공합니다.
크리에이터 및 비즈니스 워크플로우 측면에서 즉각적인 영향은 실무적입니다:
- 더 빠른 수정 주기 (revision cycles): 팀은 피드백 라운드마다 전체 클립을 다시 만드는 대신, 대화를 통해 개별적인 변경 사항을 요청할 수 있습니다.
- 더 많은 문맥적 소스 자료: 이미지, 텍스트, 비디오 및 오디오가 단순히 별개의 제작 자산으로 기능하는 대신, 응집력 있는 편집을 위한 정보로 활용될 수 있습니다.
- 잠재적으로 더 일관된 시각적 변화: 실제 세계의 문맥에 기반한다는 Omni의 명시된 근거(grounding)는 변형된 부분이 장면의 나머지 부분과 일관성을 유지하도록 하는 것을 목표로 합니다.
- 새로운 거버넌스 (governance) 고려 사항: 팀은 출처 (provenance), 지역적 액세스 제한 및 AI 생성 미디어를 검토하기 위한 내부 표준을 고려해야 합니다.
이 업데이트는 빠른 반복 (iteration)이 중요한 반복적인 내부 비디오, 교육 콘텐츠 및 프레젠테이션을 제작하는 커뮤니케이션 팀에게 특히 유용할 수 있습니다. 그럼에도 불구하고, 편집적 판단 (editorial judgment)의 필요성을 없애지는 않습니다. 텍스트 지시어는 의도된 결과를 표현할 수 있지만, 최종 비디오가 정확하고 적절하며 조직의 정책을 준수하는지에 대한 책임은 여전히 조직에 있습니다.
Gemini Omni를 기존 콘텐츠 시스템에 어떻게 통합할 수 있는지 평가하는 조직은 실질적인 비디오 및 자동화 사용 사례를 위해 Scalevise와 함께 AI 워크플로우 설계, 거버넌스 및 구현 (AI workflow design, governance and implementation)에 대해 협력할 수 있습니다.
자주 묻는 질문 (Frequently Asked Questions)
Google Vids에서 Gemini Omni는 무엇을 할 수 있나요?
Gemini Omni는 프롬프트와 이미지 참조를 통해 비디오 클립을 생성할 수 있고, 자연어 지시어를 통해 기존 푸티지 (footage)를 편집할 수 있으며, 미디어 참조를 사용한 반복적인 개선 (iterative refinements)을 지원할 수 있습니다.
Gemini Omni는 기존 비디오를 어떻게 편집하나요?
사용자는 단계별 대화를 통해 목표로 하는 변경 사항을 설명합니다. Google은 색 보정 (color grading), 조명 및 배경 변경, 배경 요소 제거 등을 예시로 들었습니다.
Gemini Omni는 어떤 미디어를 참조로 사용할 수 있나요?
Google은 Omni가 일관된 비디오 편집을 돕기 위해 이미지, 텍스트, 비디오 및 오디오를 포함한 임의의 미디어를 참조할 수 있다고 설명합니다.
Google Vids의 Gemini Omni는 어디서나 사용할 수 있나요?
Google은 2026년 7월 중순에 여러 Workspace 티어 및 소비자 플랜에 걸쳐 해당 기능을 출시했지만, 출시 자료에 따르면 유럽 경제 지역 (EEA), 영국, 텍사스 및 일리노이에서는 Omni를 사용한 비-AI 편집 (non-AI editing)에 대한 지역적 제한이 있습니다.
SynthID는 Gemini Omni 비디오 편집과 어떤 관련이 있나요?
SynthID는 생성 및 편집된 콘텐츠의 AI 출처 (AI provenance)를 확인하는 데 도움을 주기 위한 워터마킹 및 추적 가능성 (traceability) 레이어를 제공합니다.
결론 (Conclusion)
Gemini Omni는 생성 (generation), 타겟팅된 편집 (targeted editing), 그리고 문맥적 미디어 참조 (contextual media references)를 기반으로 한 반복적인 개선 (iterative refinement)을 결합하여, Google Vids에 더욱 완전한 대화형 비디오 워크플로우 (conversational video workflow)를 제공합니다. 이 기능의 유용성은 플랜 접근 권한, 지역적 가용성 및 규율 있는 검토 관행에 따라 달라질 것이며, SynthID는 AI 생성 비디오를 다루는 조직을 위해 중요한 출처 (provenance) 메커니즘을 추가합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기