Gemini Omni 1.1 Flash로 더 많은 제어로 구축할 수 있게 되었습니다
요약
Google은 개발자를 위해 생성형 비디오 기능과 창의적 컨트롤을 강화한 Gemini Omni 1.1 Flash를 공개했습니다. 이 업데이트는 기존 비디오 컨텍스트 분석 능력을 향상시켜, 최대 40초까지 끊김 없이 긴 스토리텔링이 가능하게 했습니다. 이를 통해 사용자는 더 제어 가능하고 프로덕션에 적합한 미디어 워크플로우를 구축할 수 있습니다.
핵심 포인트
- 장면 확장 기능으로 비디오를 끊김 없이 연장 가능
- 최대 10초의 이전 컨텍스트 분석으로 일관성 향상
- 누적 최대 길이 40초까지 스토리텔링 구현 가능
- 생성형 비디오 워크플로우에 대한 제어력 강화
Gemini Omni 1.1 Flash로 더 많은 제어로 구축할 수 있게 되었습니다

오늘 저희는 개발자를 지원하기 위한 새로운 창의적 컨트롤과 생성형 비디오 기능을 갖춘 Gemini Omni 1.1 Flash를 소개합니다. Gemini Omni는 실세계 추론(real-world reasoning)을 생성적 창작에 도입했으며, 오늘 업데이트된 내용은 Google AI Studio의 Gemini API를 통해 전문적인 사용을 위해 Omni 1.1을 프로덕션 레디(production-ready)하게 만듭니다.
생성형 비디오 워크플로우, 창의적 도구 또는 미디어 편집 소프트웨어를 구축하든, 이러한 업데이트는 생성형 비디오를 더 제어 가능하고, 반복하기 빠르며, 실제 배포에 적합하도록 다듬었습니다. 새로운 기능들을 살펴보겠습니다:
장면 연장으로 더 긴 스토리텔링 구현
장면 확장(Scene extension) 기능을 사용하면 기존 비디오를 가져와서 멈춘 지점부터 끊김 없이 영상을 계속 생성할 수 있습니다.
Omni 1.1을 사용하면 모델이 이제 최대 10초의 이전 컨텍스트를 분석할 수 있게 되었습니다. 이는 이전에 최종 1초만 참조했던 모델들에서 크게 발전한 부분입니다. 그 결과 시각적 일관성(visual consistency)과 서사 준수도(narrative adherence)가 향상되어, 더 긴 이야기를 만들거나 새로운 창의적인 방향으로 전개할 수 있습니다. 최대 누적 길이 40초까지 10초 간격으로 비디오를 확장할 수 있습니다.
프롬프트 1: 카메라가 살짝 패닝하고 그녀가 곱슬머리 남자와 이야기하는 것을 보고, 남자의 뒷모습이 보이고, 그가 “나도 그래”라고 말한다. 드라마틱한 음악 스코어
프롬프트 2: 카메라가 천천히 빠지면서, 잊힌 먼지 쌓인 지하 납골당(catacombs)의 모습이 보인다. 드라마틱한 음악 스코어.
프롬프트 3: 카메라가 천천히 빠지면서, 선반과 책들이 먼지 쌓인 공허 속에서 무중력으로 떠다니는 거대한 도서관의 모습이 보인다. 드라마틱한 음악 스코어.
프롬프트 1: 비디오를 계속합니다. 시네마틱 광학 돌리-줌(optical dolly-zoom) 샷을 실행합니다. 카메라가 전진하는 동시에, 캐릭터의 얼어붙은 충격받은 얼굴이 정확히 같은 크기로 고정된 채로 확대됩니다. 배경에 있는 석주들의 긴 복도가 강렬한 광학 원근 왜곡(optical perspective distortion)과 함께 드라마틱하게 늘어나고 깊어집니다. 깔끔한 건축물, 끊김 없는 연속 샷입니다.
프롬프트 2: 비디오를 계속 진행해 주세요. 카메라가 캐릭터의 커다란 눈으로 빠르게 기계적으로 스냅-줌(snap-zoom)합니다. 스타일리시한 시네마틱 카메라 컨트롤입니다.
프롬프트 3: 비디오를 계속 진행해 주세요. 시간이 완전히 정지된 순간에 고정됩니다: 캐릭터와 바람에 날린 코트. 카메라는 정지된 캐릭터 주위를 부드럽고 빠른 속도의 360도 오비탈 로테이션(orbital rotation)을 수행하며, 콜로네이드 전체에 걸쳐 극적인 3D 깊이와 패럴랙스(parallax)를 보여줍니다. 완벽한 연속성입니다.
프롬프트 1: 파란색 스웨터를 입은 남자가 대답합니다: "당신의 아버지도 배를 타고 나갔나요?"
프롬프트 2: 그가 이야기를 계속하면서 카메라가 한 번의 연속적인 움직임으로 뒤로 빠집니다: "그는 이 항구에 영혼이 있다고 말하곤 했어요. 그리고 배들이 우리 일부라고요." 음악이 고조됩니다.
프롬프트 1: (누군가가) 카메라를 똑바로 바라보며 마지막 장(chapter)이 어떻게 끝날지 이야기합니다!
프롬프트 2: 그러고는 일어서서 책상 주위를 걸어와 카메라를 향해 "당신은 무엇을 선택하겠어요?"라고 말합니다.
Gemini API를 사용하여 장면을 확장하는 방법:
from google import genai
client = genai.Client()
interaction = client.interactions.create(...)
첫 프레임과 마지막 프레임 지정하기
샷의 시작 프레임과 끝 프레임을 지정하여 부드러운 전환과 카메라 움직임을 구현할 수 있습니다. Omni 1.1은 두 개의 키프레임(keyframe) 사이에서 연속적인 비디오를 생성하므로, 복잡한 카메라 오비트, 줌 전환 또는 끊김 없는 루핑 클립에 이상적입니다.
프롬프트 1: 베이지색 정장을 입은 스타일리시한 드러머가 그랜드 홀에서 빨간 드럼 키트를 연주하는 로우-앵글(low-angle) 클로즈업 샷이, 카메라가 옆으로 휘파람처럼 패닝(whip-pans)하며 전환되고, 부드러운 보라색 무대 조명 아래 흰 옷을 입고 회전하는 발레리나와 함께 연주하는 나이가 지긋한 색소폰 연주자가 나타납니다. 끊김 없는 단일 샷, 점프컷(jump cuts) 없음.
프롬프트 2: 카메라가 TV 화면으로 줌인하며, 거기서 우리는 처음과 같은 여성과 같은 장면을 봅니다. 매끄러운 비디오. 끊김 없는 단일 샷, 점프컷 없음.
360p로 더 효율적으로 비디오 초안 작성하기
360p로 더 효율적인 비디오 초안 작성
Omni 1.1의 표준 720p 해상도 대비 최대 60% 빠르게* 그리고 비용은 3분의 1 수준으로 360p 해상도의 경량 미리보기를 생성할 수 있습니다. 이는 빠른 프로토타이핑, 스토리보드 반복 작업, 개발자 플랫폼에서의 신속한 렌더링에 도움이 됩니다.
360p 대 720p 해상도 시스템 처리량을 기반으로 최대 60% 빠른 생성 속도
프롬프트: 무지갯빛 해양 규조류의 현미경적 시야. 숨 막힐 듯한 자연스러운 대칭을 보여주는 복잡하고 유리 같은 실리카 껍질이 특징입니다. 색상은 깊은 화산 암갈색과 따뜻한 구리색부터 생생한 청록색과 보라색까지 다양하며, 지구와 바다의 풍부한 팔레트를 모방합니다. 작고 섬세한 구조물들이 깨끗하고 어두운 배경 위에서 부드럽게 빛납니다. 고화질 과학 이미징, 선명한 디테일, 유기적 질감, 현미경 사진술. 전체 비디오에 걸쳐 현미경 렌즈 효과를 유지하세요.
최대 4K 해상도로 업스케일링
Omni 1.1을 사용하여 전문적인 제작 준비가 된 고해상도 1080p 또는 4K 결과물을 생성합니다.
프롬프트 1: 헤엄치는 물고기, 트래킹 샷
프롬프트 2: 왼쪽 화면에서 숲속으로 달려 나오다가 공기를 호기심 있게 맡은 후 오른쪽 프레임 밖으로 달려 나가는 작은 다람쥐
프롬프트 3: 섬세한 가지 위의 생생한 황금빛 주황색 일본 단풍잎의 영화 같은 접사 클로즈업. 부드럽고 리듬감 있는 가을바람에 살짝 흔들리며 움직입니다. 햇빛이 반투명한 잎 사이로 스며들어 따뜻하고 빛나는 효과를 만듭니다. 얕은 피사계 심도, 꿈결 같은 보케 배경, 초현대적인 질감, 포토리얼리스틱, 4k.
멀티모달 입력에 비디오 참조 추가하기
장면을 구성할 때 최대 3초 분량의 비디오를 참조하여, 비디오 참조를 기반으로 시각적 맥락과 캐릭터 일관성을 유지할 수 있습니다.
프롬프트: 업로드된 세 개의 무용수 비디오를 사용하여 제공된 캐릭터로 대체하세요. 이들이 참조 비디오에서 각자의 춤을 추도록 하고, 모두 함께 제공된 이미지의 넓고 탁 트인 공간에서 공연하게 하세요.
강아지 캐릭터 dog.png는 dance3.mp4의 클래식 댄스를 추어야 합니다. 문어 캐릭터 octo.png는 dance1.mp4의 힙합 댄스를 추고, 곰 캐릭터 bear.png는 dance2.mp4의 브레이크댄스를 추어야 합니다. 최종 결과물은 장면 전환 없이 하나의 연속된 샷이어야 합니다.
구축할 수 있는 영감을 주는 콘셉트들
개발자들이 이러한 새로운 기능을 커스텀 도구와 창의적인 워크플로우 전반에 걸쳐 어떻게 활용할 수 있는지 보여주는 몇 가지 아이디어를 소개합니다.
이 앱에서는 시작 프레임과 마지막 프레임을 드롭하여, Omni의 전체 컨텍스트 추론(full-context reasoning) 덕분에 실제처럼 보이는 카메라 움직임을 얻을 수 있도록 프리셋이나 프롬프트 상자를 통해 그 사이의 전환을 생성할 수 있습니다.
이 앱은 카메라를 방 안으로 이동시킵니다. 아크를 그리거나, 밀고 들어가거나, 뒤로 빠집니다. 가장 이상적인 시간대에 집을 보여줍니다. 존재하지 않는 가구나 디테일은 추가하지 않습니다.
창작자들은 원하는 결과물을 얻기 전에 이미 여러 개의 비디오를 생성합니다. Draft Room은 이러한 탐색 과정을 저렴하고 구조화된 방식으로 만듭니다: 360p로 3~4가지 초안 변형을 만들고, 한 번에 하나의 요소만 변경하여 나란히 비교할 수 있습니다.
고객들이 Omni Flash를 프로덕션에 적용하는 방법 보기
저희 고객들은 이미 Agent Platform API를 통해 Gemini Omni Flash로 실제 세계의 제작을 주도하고 있습니다. 그들이 만든 비디오들을 탐색하고, 아래에서 모델을 어떻게 사용하고 있는지 들어보세요.
Adobe는 Gemini Omni Flash를 Adobe Firefly에 통합했습니다. 이 비디오에서는 해당 기능의 비디오 편집 능력을 보여줍니다.
“Gemini Omni Flash는 Figma Weave에서 사용할 수 있는 가장 강력한 비디오 모델 중 하나입니다. 여기서 캔버스는 창작팀이 모든 생성 과정에서 참조 자료를 첨부하고, 다른 버전들을 분기하며, 무언가 독특하게 형태를 갖추도록 구축하는 데 도움을 줍니다. 확장 기능(extensions), 풍부한 참조 자료, 그리고 4K 해상도를 통해 Gemini Omni Flash는 팀들을 단순히 비디오를 생성하는 단계를 넘어 진정으로 지휘하도록 이끌어갑니다.” - Itay Schiff, Creative Director, Figma Weave.
“GMI Cloud에서는 크리에이터들에게 세계에서 가장 유능한 모델들에 대한 중앙 집중식 접근성을 제공합니다. Gemini Omni Flash의 강점은 정확성입니다. 세부 사항들이 면밀히 검토되어도 유지됩니다. 교육적이고 설명적인 콘텐츠를 제작하는 고객들에게는, 정확하게 만드는 것이 필수적이므로, 그 신뢰성이 어떤 단일 기능보다 중요합니다. Omni는 이전에 의존할 수 없었던 부문에게 AI 비디오를 실현 가능하게 만들었습니다.” - Louisa Guo, GMI Cloud 마케팅 담당 부사장.
“Omni Flash는 사람들이 Runway를 이미 사용하는 방식에 자연스럽게 들어맞습니다. 프롬프트, 이미지 또는 비디오로 시작하여 거기서 생성하거나 편집할 수 있습니다. 이는 사용자들이 아이디어 사이를 빠르게 이동하는 또 다른 방법입니다.” – Jamie Umpherson, Runway 최고 크리에이티브 책임자.
Gemini Omni 1.1 Flash로 오늘부터 구축하기
Gemini Omni 1.1 Flash의 가격표.

Omni 1.1은 Google 개발자 생태계 전반에 걸쳐 출시되고 있습니다:
Google AI Studio에서 구축 시작: Google AI Studio에서 Omni 1.1을 직접 사용해 보세요.
Gemini Enterprise Agent Platform에서 구축: 기업들은 Agent Platform API를 통해 Omni 1.1로 직접 구축할 수 있습니다.
개발자 문서 탐색: 공식 문서를 확인하고, 애플리케이션에 장면 확장(scene extensions), 비디오 참조(video references) 및 업스케일링(upscaling)을 통합하는 방법을 배우기 위해 요리책(cookbook)과 프롬프팅 가이드를 살펴보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기