LingBot World V2, 실시간 상호작용 비디오 생성 기능 도입
요약
robbyant가 개발한 14B 파라미터 규모의 비디오 생성 모델 LingBot World V2를 소개합니다. Wan2.2 프레임워크 기반의 인과적 트랜스포머 아키텍처를 통해 시각적 일관성을 유지하며 무제한 길이의 상호작용 가능한 비디오 시퀀스를 생성할 수 있습니다.
핵심 포인트
- 인과적 사전 학습을 통한 무제한 상호작용 지평 달성
- Fast 변형 모델을 통한 60fps 실시간 720p 비디오 스트리밍 지원
- 에이전트 방식의 캐릭터 및 환경 제어 기능 제공
- KV 캐싱을 활용한 효율적인 메모리 관리 및 청크 단위 처리
개요 (Overview)
lingbot-world-v2-14b-causal-fast
는 robbyant가 개발한 140억 개(14 billion) 파라미터 규모의 비디오 생성 모델로, 이미지 및 텍스트 프롬프트로부터 에이전트 방식의 캐릭터 및 환경 제어를 통해 상호작용 가능한 비디오 시퀀스를 생성합니다. 이 모델은 Wan2.2 프레임워크를 기반으로 구축된 인과적 트랜스포머 (Causal Transformer) 아키텍처를 사용하며, 정교하게 설계된 인과적 사전 학습 (Causal Pretraining) 패러다임을 통해 무제한의 상호작용 지평 (Unbounded Interaction Horizons)을 달성하도록 학습되었습니다. 이는 시각적 일관성을 유지하면서 임의의 길이의 비디오 시퀀스를 생성할 수 있음을 의미합니다. Fast 변형 모델은 실시간 추론 (Real-time Inference)을 위해 특별히 증류 (Distilled)되었으며, 60fps(초당 프레임 수)의 속도로 720p 비디오 스트림을 구동할 수 있습니다. 테스트된 구성에서는 최대 361프레임에 달하는 480p 해상도의 출력을 생성하며, 메모리를 효율적으로 관리하기 위해 KV 캐싱 (KV Caching)을 사용하여 비디오를 청크(Chunk) 단위로 처리합니다. 최적화된 추론을 위해 PyTorch 2.4.0 이상 및 flash-attention이 필요합니다. 이 모델은 Hugging Face 및 ModelScope를 통해 CC BY-NC-SA 4.0 라이선스로 배포되며, 상업적 이용은 제한되나 적절한 출처 표기 시 연구 및 학술적 용도로 사용이 허용됩니다.
최적의 사용 사례 (Best use cases)
캐릭터 제어를 포함한 상호작용형 월드 시뮬레이션. 이 모델은 캐릭터가 공격, 궁술, 주문 시전, 사격과 같은 텍스트 기반 액션 명령에 반응하는 일관된 비디오 시퀀스를 생성하는 데 탁월합니다. 파일럿(Pilot) 및 디렉터(Director) 에이전트를 포함한 에이전트 방식의 하네스 (Agentic Harness) 덕분에 캐릭터의 행동은 계획된 것처럼 느껴지며, 환경 변화는 무작위가 아닌 의도적인 것처럼 느껴집니다. 여러 엔티티가 명확한 주체성(Agency)을 가지고 행동하는 장기 상호작용 콘텐츠가 필요할 때 사용하십시오. 여기에는 게임 엔진, 인터랙티브 픽션 엔진, 또는 수백 프레임에 걸쳐 서사적 일관성이 중요한 훈련 시뮬레이션 등이 포함됩니다.
텍스트 설명을 통한 기존 장면 확장. 단일 이미지와 상세한 텍스트 프롬프트(text prompt)가 주어지면, 모델은 해당 장면을 시간의 흐름에 따라 확장하는 비디오를 생성합니다. 인과적 아키텍처 (causal architecture) 덕분에 이 작업에서 특히 강력한 성능을 발휘하는데, 이는 모델이 순차적으로 처리하며 초기 이미지에 의해 설정된 시각적 문법 (visual grammar)을 유지하기 때문입니다. 이는 정지 영상을 영화적 샷 (cinematic shots)으로 확장하거나, 단일 사진으로부터 건축물 워크스루 (architectural walkthroughs)를 만들거나, 원하는 미학적 스타일과 일치하는 이미지가 있을 때 스톡 푸티지 (stock footage)를 확장하는 크리에이티브 도구에 이상적입니다.
중간 해상도의 실시간 월드 생성 스트리밍. 빠른 변체 (fast variant)는 풀 퀄리티 모델의 연산 오버헤드 (compute overhead) 없이 480p 해상도에서 비디오 생성을 지속할 수 있습니다. 만약 귀하의 애플리케이션이 라이브 또는 실시간에 가까운 생성 비디오—인터랙티브 VR 환경, 스트리밍을 위한 실시간 절차적 배경 생성 (real-time procedural background generation), 또는 게임 엔진에서의 동적 장면 생성—를 필요로 한다면, 실시간 성능을 위해 증류 (distillation)된 이 모델(청크당 4번의 추론 단계)은 기본 인과적 사전 학습 모델 (base causal-pretrained model)이 너무 느릴 수 있는 환경에서 실용적인 대안이 됩니다.
일관성 제약 조건을 갖춘 롱폼 (long-form) 비디오 연속 생성. 무제한의 상호작용 지평 (unbounded interaction horizon)이 여기서 가장 돋보이는 특징입니다. 50100 프레임 이후 품질이 저하되는 모델들과 달리, 이 모델은 기하학적 및 의미론적 일관성 (geometric and semantic consistency)을 유지하면서 361프레임 이상의 시퀀스를 생성합니다. 확장된 영화적 시퀀스 제작, 생성된 환경을 통과하는 롱테이크 카메라 움직임, 또는 눈에 보이는 드리프트 (drift)나 붕괴 없이 1015초 이상 지속되는 비디오가 필요한 모든 시나리오에 이를 사용하십시오.
텍스트 기반 환경 내러티브 (Text-driven environmental narrative). 이 모델에는 "장면이 진행됨에 따라 새로운 환경 요소를 합성하는 책임을 지는 디렉터 에이전트 (director agent)"가 포함되어 있습니다. 이는 환경 자체가 캐릭터뿐만 아니라 사용자의 텍스트 설명에 따라 진화한다는 것을 의미합니다. 날씨가 변하는 호숫가 장면, 시간의 흐름에 따라 변화하는 조명, 또는 내러티브가 전개됨에 따라 새로운 물체가 나타나는 등 설정이 변하는 비디오를 생성하는 데 완벽합니다.
한계점 (Limitations)
비상업적 라이선스 전용 (Non-commercial license only). CC BY-NC-SA 4.0 라이선스는 상업적 이용을 명시적으로 제한합니다. 명시적인 허가 없이 이 모델의 출력물을 사용하여 제품이나 서비스를 판매하거나 상업적 애플리케이션에 통합할 수 없습니다. 2차 저작물은 동일한 제한적 라이선스 하에 배포되어야 합니다. 사용 사례에 상업적 배포가 필요한 경우, 이 모델을 사용할 수 없습니다.
상당한 GPU 메모리 및 멀티 GPU 요구 사항 (Significant GPU memory and multi-GPU requirement). 추론(inference) 예시는 FSDP (fully sharded data parallel) 학습을 위해 8개의 GPU를 사용하며, 이는 추론 시점에도 상당한 연산 능력이 필요함을 시사합니다. README에는 GPU당 VRAM 요구 사항이 명시되어 있지 않지만, 14B 파라미터 모델로 361프레임의 480p 비디오를 생성하려면 강력한 인프라가 필요하며, 최소 40GB 이상의 총 VRAM이 요구될 가능성이 높습니다. 단일 GPU 사용자는 제공된 추론 코드를 사용할 수 없습니다.
제한된 출력 해상도 (Limited output resolution). 테스트는 480p (480×832 픽셀)에서 수행되었습니다. 이는 웹 및 모바일 애플리케이션에는 적절하지만, 데스크톱 재생이나 고품질 아카이빙에 기대되는 720p+ 표준에는 미치지 못합니다. 이 모델이 생성 품질이 아닌 실시간 배포를 위한 성능 한계치로 "60fps에서의 720p"를 목표로 한다는 점을 고려할 때, 해상도 제한은 튜닝의 선택이라기보다 구조적인 문제로 보입니다.
증류 (Distillation)에도 불구하고 완만한 추론 속도. 빠른 변체 (fast variant)는 청크당 단 4회의 추론 단계 (inference steps)만을 사용하며, 이는 베이스 인과적 사전 학습 모델 (base causal-pretrained model, 40단계)보다 빠르지만, 절대적인 지연 시간 (latency)은 제공되지 않습니다. 8개의 GPU를 통해 361개의 프레임을 생성하는 것은 최적화된 경우라도 수 분이 소요될 가능성이 높습니다. 진정한 실시간 애플리케이션을 위해서는 외부 배포 서비스 (SGLang 또는 flashdreams)를 권장합니다. 유지 관리자가 내부 배포 코드를 공개하지 않겠다고 명시적으로 밝혔기 때문입니다.
불완전한 모델 라인업. 2026년 7월 문서 기준으로 인과적 사전 학습 14B 모델과 두 가지 1.3B 변체 (causal-fast 및 causal-pretrained)는 아직 출시되지 않은 상태입니다. 현재는 14B causal-fast 변체만 사용할 수 있습니다. 더 높은 품질의 베이스 모델이나 자원이 제한된 환경을 위한 더 작은 파라미터가 필요한 경우, 기다리거나 직접 아키텍처를 구현해야 합니다.
외부 프레임워크에 대한 의존성. 코드베이스는 전적으로 Wan2.2를 기반으로 구축되었으며, 설치를 위해서는 별도의 저장소를 클론하고 특정 컴파일러 플래그와 함께 flash-attention을 설치해야 합니다. 이는 업스트림 라이브러리가 업데이트됨에 따라 깨질 수 있는 의존성 체인을 형성하며, flash-attention 설치는 서로 다른 CUDA/PyTorch 버전 사이에서 매우 취약하기로 악명이 높습니다.
문서화되지 않은 품질 저하. README에는 실패 사례 분석이나 품질 지표 (LPIPS, FVD, 시간적 일관성 점수)가 제공되지 않습니다. 361 프레임에서 짧은 시퀀스에 비해 시각적 일관성 (visual coherence)이 어떻게 저하되는지, 특정 동작 유형에 따른 알려진 실패 모드가 있는지, 또는 모델이 부드러운 연속 동작과 급격한 장면 전환을 어떻게 처리하는지는 불분명합니다.
비교 분석
lingbot-world-base-cam은 동일한 유지 관리자가 만든 이전 세대 모델입니다. lingbot-world-v2-14b-causal-fast를 선택하십시오.
만약 제한 없는 시퀀스 길이 (unbounded sequence length), 에이전트 기반 캐릭터 플래닝 (agentic character planning), 또는 실시간 성능이 필요하다면, 이 모델은 이러한 기능들이 추가된 직접적인 진화 모델입니다. 제한적인 CC BY-NC-SA 4.0 라이선스 대신 Apache 2.0 상업적 라이선스 (v1에서 허용됨)가 필요하거나, 명시된 개선 사항을 고려할 때 가능성은 낮지만 v1이 귀하의 특정 콘텐츠 유형에서 더 나은 성능을 보인다는 증거가 있는 경우에만 베이스 모델 (base model)을 사용하십시오.
Tencent의 HY-World-2.0은 비디오가 아닌 3D 장면을 재구성하고 생성하는 폐쇄형 소스 (closed-source) 3D 월드 모델 (world model)입니다. 다운스트림 편집 (downstream editing), 물리 시뮬레이션 (physics simulation), 또는 에셋 추출 (asset extraction)을 위해 3D 메쉬 (3D mesh) 또는 볼륨 데이터 (volumetric output)가 필요한 경우 이 모델을 선택하십시오. 이 모델은 다른 출력 형식을 목표로 합니다. 비디오 출력, 텍스트 명령을 통한 상호작용, 또는 연구를 위한 오픈 소스 가중치 (open-source weights)가 필요한 경우에는 lingbot-world-v2-14b-causal-fast를 선택하십시오. HY-World는 3D 측면에서는 더 강력하지만 폐쇄적이며 상업적입니다.
Qwen의 WebWorld-8B는 웹 상호작용 및 환경 모델링을 위한 언어 모델 (language model)이며, 비디오 생성 모델이 아닙니다. 비디오 시퀀스를 생성해야 한다면 lingbot-world-v2-14b-causal-fast를 선택하십시오. 웹 기반 또는 텍스트 기반 환경에서 동작을 시뮬레이션하거나 계획해야 한다면 WebWorld를 선택하십시오. 이 모델들은 서로 직교하는 문제, 즉 비디오 생성 대 환경 시뮬레이션이라는 서로 다른 문제를 해결합니다.
BAAI의 RoboBrain2.0-7B는 모터 제어 (motor control) 및 로봇 특화 작업에 집중하는 로봇 조작 (robotic manipulation) 모델입니다. 일반적인 장면, 캐릭터 및 서사 중심의 콘텐츠를 위한 시각적 월드 생성 (visual world generation)이 필요한 경우에는 lingbot-world-v2-14b-causal-fast를 선택하십시오. 로봇 컨트롤러를 훈련하고 체화된 행동 계획 (embodied action planning)이 필요한 경우에는 RoboBrain을 선택하십시오. RoboBrain은 하드웨어 제어에 특화되어 있는 반면, 이 모델은 시각적 콘텐츠 제작을 위한 것입니다.
Tencent의 HY-WorldPlay는 기하학적 일관성 (geometric consistency)과 실시간 지연 시간 (real-time latency)을 강조하는 또 다른 스트리밍 비디오 확산 모델 (diffusion model)입니다. 두 모델 모두 유사한 사용 사례(대화형 비디오 생성, 실시간 성능)를 목표로 하지만, HY-WorldPlay는 폐쇄형 소스 (closed-source)이며 상업적 기업에서 제공하는 반면, lingbot-world-v2-14b-causal-fast는 연구용 라이선스가 포함된 오픈 소스 (open-source)입니다. 오픈 웨이트 (open weights)와 커뮤니티 중심의 개발이 필요하다면 이 모델을 선택하십시오. 만약 Tencent의 프로덕션 인프라와 지원을 이용할 수 있고 라이선스가 허용된다면 HY-WorldPlay를 선택하십시오.
기술 사양 (Technical specifications)
아키텍처 (Architecture): Wan2.2를 기반으로 구축된 인과적 트랜스포머 확산 모델 (Causal transformer diffusion model)로, FSDP 병렬화 (parallelization) 지원 및 로컬 어텐션 (local attention) 메커니즘을 갖춘 확산 트랜스포머 (DiT) 백본을 사용합니다. 이 모델은 인과적 추론 (causal inference)을 위해 KV 캐싱 (KV caching)을 채택하여 비디오 프레임을 한꺼번에 처리하는 대신 청크 (chunks) 단위로 순차적으로 처리함으로써 긴 길이의 생성 (long-form generation)을 가능하게 합니다.
파라미터 (Parameters): 출시된 causal-fast 변체는 140억 (14 billion) 개의 파라미터를 가집니다.
출력 해상도 (Output resolution): 테스트된 최대 해상도는 480p (480×832 픽셀)입니다. 이 아키텍처는 외부 배포 서비스를 통한 실시간 스트리밍을 위해 60 fps에서 720p를 목표로 합니다.
시퀀스 길이 (Sequence length): 단일 추론 패스 (inference pass)에서 최대 361 프레임을 생성함을 테스트하고 확인했습니다. 인과적 사전 학습 (causal pretraining) 패러다임은 시각적 일관성 (visual consistency)의 저하가 기록되지 않은 상태에서 무제한의 시퀀스 생성을 가능하게 합니다.
추론 설정 (Inference configuration): 제공된 예시는 --ulysses_size 8 (Ulysses 어텐션 병렬화), --local_attn_size 18 (18 프레임의 로컬 어텐션 윈도우), --sink_size 6 (sink token 메커니즘)을 사용하여 8개의 GPU를 사용합니다. 이러한 파라미터는 구성 가능하지만 유연하지는 않습니다. GPU 수를 줄이려면 분산 추론 (distributed inference) 코드를 다시 작성해야 합니다.
추론 단계 (Inference steps): causal-fast 변체의 경우 청크당 4번의 확산 단계 (diffusion steps)를 사용합니다 (속도를 위해 증류 (distilled)됨). 미출시된 causal-pretrained 모델은 classifier-free guidance를 사용하여 40단계를 사용합니다.
프레임워크 (Framework): PyTorch 2.4.0 이상 버전이 필요합니다. 추론 (Inference) 시 모델 로딩 및 생성을 위해 Diffusers 라이브러리를 사용합니다.
필수 의존성 (Required dependencies): flash-attention (빌드 격리 없이 컴파일됨), CUDA 지원 PyTorch, 별도로 클론된 Wan2.2 코드베이스 (codebase).
입력 형식 (Input formats): 단일 RGB 이미지 (JPEG/PNG 형식, 차원은 프롬프트 해상도와 일치), 액션 시퀀스 데이터 (--action_path 디렉토리로부터 가져옴), 그리고 장면과 원하는 상호작용을 설명하는 텍스트 프롬프트 (text prompts).
모델 가중치 형식 (Model weights format): Safetensors 또는 PyTorch pickle 형식이며, Hugging Face 또는 ModelScope에서 다운로드할 수 있습니다.
어텐션 메커니즘 (Attention mechanism): 전체 셀프 어텐션 (full self-attention)과 로컬 어텐션 (local attention)을 모두 지원합니다 (--local_attn_size를 통해 설정 가능). 여러 GPU에 걸친 분산 추론을 위해 Ulysses 어텐션 병렬화 (Ulysses attention parallelization)를 지원합니다.
T5 텍스트 인코딩 (T5 text encoding): 텍스트 임베딩 (text embedding)을 위해 별도의 T5 모델을 사용하며, --t5_fsdp 플래그를 통해 GPU에 분산됩니다.
모델 입력 및 출력 (Model inputs and outputs)
입력 (Inputs)
이미지 (Image): 초기 프레임 역할을 하는 단일 PNG 또는 JPEG 이미지 (해상도 무관, 대상 해상도로 자동 크기 조정됨)
텍스트 프롬프트 (Text prompt): 장면과 원하는 서사 전개에 대한 상세한 설명 (예시에서는 환경, 분위기, 캐릭터 동작을 설명하는 50단어 이상의 프롬프트를 보여줌)
액션 시퀀스 (Action sequence): 액션 사양을 포함하는 디렉토리 경로 (README에 형식이 완전히 문서화되어 있지는 않으나, 예시에서는 "attacking", "archery", "spell-casting"과 같은 구조화된 액션 데이터를 참조함)
설정 파라미터 (Configuration parameters): 프레임 수 (최대 361프레임 테스트됨), 해상도 (예시에서는 480×832로 하드코딩됨), 어텐션 파라미터 (ulysses_size, local_attn_size, sink_size), GPU 개수, 그리고 체크포인트 (checkpoint) 디렉토리
출력 (Outputs)
비디오 파일 (Video file): 디렉토리에 저장되거나 비디오 컨테이너 형식으로 저장되는 480p RGB 프레임 시퀀스 (480×832 해상도, 구체적인 형식은 README에 문서화되지 않음)
프레임 수 (Frame count): 사용자가 지정하며, 최대 361프레임까지 테스트됨
프레임 레이트 (Frame rate): 생성된 프레임 (실시간 배포를 위한 목표는 60 fps이지만, 원시 추론 (raw inference) 단계에서 프레임 레이트를 강제하지는 않음)
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기