AI 영상 생성: 기존의 3~5초 한계를 돌파한 Wan 3.0의 기술적 고찰 및 30초 연속 생성 성능 검증
요약
기존 Text-to-Video 모델의 3~5초 길이 제한과 시간적 일관성 문제를 해결한 Wan 3.0을 소개합니다. 이 모델은 Diffusion Transformer(DiT)와 확장 컨텍스트 윈도우를 채택하여, 캐릭터 동일성 유지 및 물리 법칙 기반의 장편 시퀀스 생성이 가능함을 검증했습니다.
핵심 포인트
- Wan 3.0은 DiT 패러다임과 확장 컨텍스트 윈도우를 사용합니다.
- 30초 연속 생성에서 높은 시간적 일관성을 입증했습니다.
- 캐릭터 동일성 유지, 복잡한 카메라 워크 구현이 가능해졌습니다.
최근 텍스트-투-비디오 (Text-to-Video) 모델의 진화는 눈부시지만, 영상 제작 현장이나 개발자들 사이에는 여전히 큰 구조적 제약이 존재해 왔습니다. 그것은 바로 **'시간적 일관성(Temporal Consistency)의 붕괴'**와 **'클립 길이의 상한선'**입니다.
많은 기존 모델들은 실용적인 품질을 유지할 수 있는 길이가 3~5초 정도로 제한되어 있었습니다. 이보다 긴 장편 생성을 시도할 경우, 다음과 같은 치명적인 아티팩트가 발생하기 쉬웠습니다.
- 캐릭터의 동일성 상실 (Identity Decay): 몇 프레임만 지나도 인물의 얼굴 특징이나 의상, 헤어스타일이 변형됨
- 공간 논리의 파탄: 카메라 워크 이동에 따라 배경 오브젝트가 부자연스럽게 모핑됨
- 물리 현상의 불일치: 액체나 연기, 그림자의 움직임이 프레임 간 깜빡거림(Flickering)을 일으킴
본고에서는 이러한 과제들에 대응하여 30초의 연속 생성과 높은 일관성을 실현한 Wan 3.0의 기술적 접근 방식과 실제 검증 결과를 고찰합니다.
Wan 3.0은 기존의 UNet 기반 접근 방식에서 발전된 Diffusion Transformer (DiT) 패러다임과 확장 컨텍스트 윈도우를 채택하고 있습니다. 이를 통해 프레임별 미세한 오차가 누적되는 것을 억제하고, 길게 펼쳐진 타임라인 전체에 걸쳐 의미론적 앵커(Semantic Anchors)를 유지하는 것이 가능해졌습니다.
실제로 Wan 30 AI의 웹 생성 환경을 사용하여 검증을 진행한 결과, 30초라는 장편 시퀀스에서 다음과 같은 세 가지 측면에서 현저한 우위성을 확인할 수 있었습니다.
- 피사체가 한 번 카메라 바깥쪽으로 돌아 나갔다가 다시 시선을 돌리는 역동적인 액션에서도, 골격, 얼굴 파츠, 장식품의 특징 벡터가 리셋되지 않고 동일 인물로서 안정적으로 그려집니다.
- 기존 모델에서는 파탄하기 쉬웠던 '돌리인(Dolly-in)', '팬(Pan)', '랙 포커스(초점 심도의 이동)'와 같은 연출 의도에 대해, 배경의 왜곡을 최소화하면서 부드러운 카메라 움직임을 시뮬레이션할 수 있습니다.
- 빛이 비추는 방향, 그림자가 지는 방향, 수면이나 미세 입자의 유체 역학이 24fps 프레임 전반에 걸쳐 물리 법칙에 근거하여 보간됩니다.
Wan 3.0과 같은 장편 생성 모델의 잠재력을 최대한 끌어내기 위해서는 시간 축을 의식한 프롬프트 구성이 효과적입니다.
[시계열 구성 프롬프트의 구성 예]
Phase 1: Establishing cinematic shot of modern laboratory at night.
Phase 2: Slow tracking camera moving toward researcher examining hologram interface.
...
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기