Gemini Omni 소개
요약
Gemini Omni는 모든 입력으로부터 무엇이든 생성할 수 있는 새로운 멀티모달 모델로, 특히 고품질의 비디오 생성을 핵심 기능으로 합니다. 사용자는 이미지, 오디오, 비디오, 텍스트를 결합하여 Gemini의 실제 세계 지식에 기반한 영상을 만들고, 자연어 대화를 통해 영상 편집 및 재구상이 가능합니다.
핵심 포인트
- Omni는 모든 입력으로부터 무엇이든 생성하는 멀티모달 모델입니다.
- 자연어 명령으로 비디오를 쉽게 편집하고 액션을 재구성할 수 있습니다.
- 중력, 유체 역학 등 물리 법칙을 이해하여 현실적인 영상을 만듭니다.
- Gemini의 세계 지식을 활용해 스토리텔링 기반의 시각 자료 생성이 가능합니다.
Gemini Omni 소개
작년에는 Nano Banana를 통해 Gemini의 지능을 이미지 생성 및 편집에 활용할 수 있게 했습니다. 그 이후로 이 기능은 수백만 명의 사람들이 오래된 사진을 복원하고, 스케치에서 디자인하며, 이전에는 불가능했던 방식으로 아이디어를 시각화하는 데 도움을 주었습니다. 처음부터 우리는 Gemini를 근본적으로 멀티모달(multimodal)하도록 구축해 왔으며, 이제 다음 단계로 나아갑니다.
Gemini Omni를 소개합니다. 여기서 Gemini의 추론 능력이 창조 능력과 만납니다. Omni는 모든 입력으로부터 무엇이든 생성할 수 있는 우리의 새로운 모델이며, 비디오부터 시작합니다. Omni를 사용하면 이미지, 오디오, 비디오, 텍스트를 입력으로 결합하여 Gemini의 실제 세계 지식에 기반한 고품질 비디오를 생성할 수 있습니다. 또한 대화를 통해 쉽게 비디오를 편집할 수도 있습니다.
오늘 저희는 Omni 제품군의 첫 번째 모델인 Gemini Omni Flash를 Gemini 앱, Google Flow, 그리고 YouTube Shorts에 출시합니다. 시간이 지나면서 이미지 및 오디오와 같은 출력 모달리티(output modalities)도 지원할 예정입니다. Omni가 특별한 몇 가지 특징을 소개합니다:
대화를 통해 비디오 편집하기
Gemini Omni는 자연어(natural language)를 사용하여 비디오를 더 쉽게 편집할 수 있게 해줍니다. 모든 지침은 이전 지침에 기반하여 구축됩니다. 캐릭터의 일관성을 유지하고, 물리 법칙을 준수하며, 장면이 이전에 발생했던 것을 기억합니다.
주변 환경 변형하기. 특정 사물만 바꾸거나, 모든 것을 바꿀 수 있습니다. 당신의 비디오는 스스로 촬영할 수 없었던 무언가의 시작점이 됩니다.
프롬프트: 조각상을 거품으로 만들어 주세요.
액션 재구상하기. 찍은 비디오를 가져와 Omni에게 무슨 일이 일어나고 있는지 바꾸라고 요청하기만 하면 됩니다. 액션을 편집하거나, 새로운 캐릭터 또는 사물을 추가하거나, 순간을 예상치 못한 무언가로 변형할 수 있습니다.
프롬프트: 사람이 거울에 닿을 때, 거울이 액체처럼 아름답게 물결치게 하고, 사람의 팔은 반사되는 거울 재질로 바뀌게 하세요.
프롬프트: 방의 조명을 어둡게 하세요. 손 위를 추적하며 떠다니는 유리 구체 안에 흑백 체크무늬 방을 배치하고, 그 안에는 이 구체를 들고 있는 같은 손의 재귀적 표현이 담겨 무한히 반복되는 방을 만드세요. 카메라가 구체 속으로 천천히 다가가며 비디오 루프를 생성합니다.
프롬프트: 아파트의 조명이 음악과 동기화되어 켜지기 시작합니다.
여러 차례에 걸쳐 비디오를 개선하세요. 원래 장면의 흐름을 놓치지 않으면서 환경, 각도, 스타일 또는 특정 세부 사항을 변경할 수 있습니다. 캐러셀을 스크롤하여 편집이 어떻게 서로 쌓여가는지 확인해 보세요.
프롬프트: 바이올리니스트가 노래를 연주하는 비디오.
프롬프트: 바이올리니스트를 이미지 환경으로 이동시키세요.
프롬프트: 바이올린을 보이지 않게 만드세요.
프롬프트: 카메라 각도를 바이올리니스트의 어깨 너머로 변경하세요.
Gemini의 세계 지식에 기반하여 아이디어를 현실화하기
Gemini Omni는 단순히 실제처럼 보이는 장면을 만드는 것을 넘어, 다음에 무슨 일이 일어날지 추론합니다. 직관적인 물리 이해와 역사, 과학 및 문화적 맥락에 대한 Gemini의 지식을 결합하여 포토리얼리즘에서 의미 있는 스토리텔링으로 간극을 메웁니다.
더 정확한 물리를 가진 시각 자료를 만드세요. Omni는 중력, 운동 에너지, 유체 역학과 같은 힘에 대한 개선된 직관적 이해를 가지고 있어 더욱 현실적인 장면을 만들 수 있게 합니다.
프롬프트: 연쇄 반응 스타일 트랙 위에서 빠르게 굴러가는 구슬, 연속적이고 부드러운 샷.
지식과 창의성을 결합하세요. Omni는 Gemini의 지식을 활용하여 패턴 매칭을 훨씬 뛰어넘는 방식으로 언어, 이미지 및 의미를 연결합니다.
프롬프트: 비디오는 알파벳 항목들을 보여줍니다. 각 글자로 시작하는 특이한 물건들이 테이블 위에 앉아 있는 모습(예: C에 대한 카피바라, D에 대한 디스코 볼, L에 대한 라바 램프). 모든 26개 글자는 해당 글자가 표시된 하단 자막과 함께 26개의 항목으로 표현되어야 합니다. 한 번에 하나의 항목과 하단 자막만 보여줍니다. 각 하단 자막은 왼쪽 아래에 종이에 검은색 마커로 쓰인 것처럼 보여야 합니다. 빠른 속도로, 24FPS에서 항목당 대략 9프레임입니다. 마지막 프레임은 'THE END'라고 적힌 종이입니다. 전체 비디오는 차분하고 부드러운 음악과 함께합니다.
복잡한 아이디어를 시각화로. Omni는 짧은 프롬프트만으로도 설득력 있는 설명 영상(explainer)을 만들 수 있으며, 더 복잡한 아이디어들을 분해하는 시각 자료를 생성합니다.
프롬프트: 단백질 접힘에 대한 클레이메이션(claymation) 설명 영상. 모든 것이 점토로 만들어졌으며, 손은 보이지 않습니다. 스톱 모션, 정확하게
어떤 조합의 입력으로든 비디오 제작하기
무엇이든 참고할 수 있습니다. Omni는 이미지, 텍스트, 비디오 또는 오디오와 같은 모든 참조 자료를 단일하고 응집력 있는 결과물로 변환합니다. 현재는 음성(voice) 참조만 지원하지만, 곧 다른 유형의 오디오 입력도 출시될 예정입니다.
프롬프트: image_0.png를 기반으로 한 역동적인 SF 영화 스타일 비디오. 요소들이 audio_0.wav의 비트에 맞춰 video_0.mp4처럼 빛납니다.
프롬프트: video-0에서 보여준 극단적인 카메라 움직임, 시점, 왜곡을 참고하여, image-0의 캐릭터가 전면을 향해 걸어가는 전신 워크 사이클(walk cycle)을 생성하되, 현실적인 영화 스타일부터 시작하여 걷는 동안 여러 시각적 스타일로 빠르게 변환합니다. 환경은 유지하고 스타일만 변경합니다. 배경은 항상 하늘을 중앙에 배치하며 하드컷됩니다. 지속적인 걷기, 지속적인 오디오, 그리고 비트에 완벽하게 동기화된 스타일 변화를 보여줍니다. 영화 같은 느낌, 16:9.
프롬프트: 내가 각 양치류 잎을 만질 때 동기화되는 하프 소리를 추가해 주세요. 잎 구조를 모두 반투명한 3D 생체 발광 식물처럼 보이도록 바꾸고, 내가 연주함에 반응하는 생체 발광 반딧불이가 주변을 날아다니게 해주세요. 사운드와 동기화된 미묘한 보케(bokeh) 심도 표현과 다이나믹 조명을 사용하여 방 벽에 반사되게 하면서 방 구조는 그대로 유지해 주세요.
현재 가지고 있는 것부터 시작하세요. 입력 참조를 사용하면 캐릭터, 장면 또는 그림 이미지를 활용하여 원하는 비전에 맞게 제작할 수 있습니다.
프롬프트: 내가 걸어갈 때 세상이 점진적으로 레트로 퓨처리즘 스타일(image-1처럼 그레인하고 분위기 있게)로 변하는 것을 상상해 보세요. 오디오를 사용하여 레트로 퓨처리즘 배경 음악을 사용하세요. 10초.
프롬프트: 그림은 움직임의 가이드로만 사용하고, 최종 비디오에 그림이 나타나지 않게 하여 이 내용을 사실적인 영상으로 만드세요.
프롬프트: 입력 비디오의 포즈와 움직임을 이 이미지의 캐릭터에 적용하세요. 이미지 참조에서 스타일을 가져와 새로운 비디오에 적용하세요.
스타일, 움직임 또는 효과를 적용하세요. 입력 참조를 사용하거나 자연어로 설명하여 시각적 언어를 정의할 수 있습니다. Omni는 입력 참조들을 혼합하여 일관성 있는 클립을 만듭니다.
프롬프트: 모든 것을 그대로 유지하면서 이 내용을 편집해 주세요. 스케이트보드에서 나오는 애니메이션 움직임 효과를 추가해 주세요.
프롬프트: 제공된 비디오 속 고래가 헤엄치는 움직임을 유동적이고 반사되는 재질의 이미지에 적용하세요. 고래나 물은 보여주지 말고, 대신 이 반사되는 움직이는 재료가 고래처럼 보이는 모양을 형성하며 헤엄치게 하세요. 물은 흰색의 부드러운 재질 형태로 대체하여 움직이게 하세요.
자신만의 디지털 아바타로 비디오를 만드세요
우리는 AI를 책임감 있게 개발하는 데 전념하고 있으며, 사용자 보호와 당사 AI 도구 사용을 규제하기 위한 명확한 정책을 가지고 있습니다. 시작으로, Avatars 기능을 사용하여 자신의 목소리로 비디오를 만들 수 있습니다. 이 기능은 자신을 디지털 버전으로 만들어 마치 본인처럼 보이거나 들리는 비디오를 생성할 수 있게 해줍니다. 아바타 기능 외에도 오디오와 음성을 변경하는 비디오 편집 측면에서는 현재 테스트하고 사용자에게 책임감 있게 이 기능을 어떻게 제공할 수 있을지 더 잘 이해하기 위해 노력하고 있습니다.
Omni로 생성된 모든 비디오에는 저희의 눈에 보이지 않는 SynthID 디지털 워터마크가 포함됩니다. Gemini 앱, Chrome의 Gemini, Google 검색을 통해 비디오가 Gemini Omni로 생성되었는지 쉽게 확인할 수 있습니다. 콘텐츠 투명성 및 검증 도구를 어떻게 확장하여 웹 전반에서 콘텐츠가 어떻게 생성되고 편집되었는지 이해하는 데 도움을 드릴 수 있는지에 대한 자세한 내용은 블로그 게시물에서 확인하실 수 있습니다.
Gemini Omni 사용해보기
앞으로 몇 주 동안 개발자 및 기업 고객에게도 API를 통해 출시할 예정입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Google DeepMind의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기