WorldCrafter: 이미지 한 장으로 탐색하고 돌아올 수 있는 AI 세계 만들기
요약
WorldCrafter는 이미지 또는 텍스트 설명만으로 탐색 가능한 AI 세계를 생성하는 영상 월드 모델입니다. 이 모델은 카메라 이동 시 사물과 공간의 일관성을 유지하며, '3D 인식 메모리' 기능을 통해 과거 관찰 정보를 기억하고 새로운 시점에서 복원합니다. Base(140억 매개변수)와 Fast 모델을 공개하여 학술 연구 목적으로 활용 가능합니다.
핵심 포인트
- 이미지/텍스트 기반으로 탐색 가능한 AI 세계 생성
- 3D 인식 메모리로 공간 및 사물 일관성 유지
- 카메라 위치/방향 기반의 과거 정보 조회 기능 구현
- Base(140억 매개변수)와 Fast 모델 가중치 공개
- Tencent ARC Lab과 베이징대학교가 개발한
영상 월드 모델로, 이미지 한 장이나 텍스트 설명에서 시작해 카메라를 움직이며 탐색하는 장면을 생성 - 시선을 돌렸다 돌아왔을 때
앞서 본 사물과 공간을 기억해 복원하며, 분 단위로 이어지는 탐색에서도 장면의 일관성을 유지 - 원하는 시점에 필요한 과거 관찰을 가져오는
3D 인식 메모리와 최근 영상의 움직임 정보를 결합해, 정적인 공간과 움직이는 피사체를 함께 처리
140억 매개변수 Base 모델과 고속 추론용 Fast 모델의 가중치, 키보드로 카메라를 조작하는 브라우저 데모와 서버 코드를 공개 - 이미지·텍스트 기반 영상 생성과 여러 이미지에서 새로운 시점 만들기를 지원하며,
라이선스는 학술 목적만 허용하고 상업적·프로덕션 사용은 금지
돌아왔을 때도 같은 세계가 남아 있도록
-
영상 월드 모델은 사용자가 카메라를 움직일 때마다
다음에 보일 장면을 생성함 -
탐색이 길어지면 최근 영상에 없는 공간을 잊기 쉬우므로, 한 번 보았던 장소로 돌아왔을 때 사물의 모습이나 공간 구조가 달라질 수 있음
WorldCrafter는 최근 프레임만 이어 붙이는 대신, 이전에 관찰한 장면을 기억하고 새로운 시점에서 다시 활용함 -
다른 방향을 살펴본 뒤 원래 시점으로 돌아오는 탐색
-
움직이는 대상을 따라가는 카메라 이동
-
피사체가 화면 밖으로 나갔다 다시 나타나는 상황 등에서 일관성을 유지하도록 설계됨
-
이미지 한 장에서 아직 보이지 않았던 주변을 생성하거나, 텍스트로 설명한 공간을 카메라 경로에 따라 탐색할 수 있음
— 프로젝트 소개와 생성 예시
카메라 시점에 맞춰 꺼내는 3D 인식 메모리
-
핵심은
카메라 위치와 방향을 기준으로 조회하는 메모리임 -
과거에 관찰한 여러 시점의 정보를 메모리 인코더에 통합함
-
다음에 보여줄 시점에 맞춰 필요한 정보를 정해진 수의 메모리 토큰으로 압축하고, 영상 생성기에 전달함
-
과거 영상 전체를 그대로 넣는 대신,
지금 생성할 화면에 필요한 기억을 골라 전달하는 구조임 -
메모리 인코더와 시점별 정보를 읽는 모듈은 영상 생성기와 함께 학습하며, 명시적인 깊이 기반 대응 관계 없이 공간 정보를 활용함
장면의 기억과 최근 움직임은 함께 사용함 -
메모리는 이전에 본 공간과 사물 정보를 보존함
-
최근 영상 문맥은 진행 중인 움직임을 이어가는 데 사용함
— 논문
이미지와 텍스트에서 시작하는 탐색
이미지 기반 생성은 입력 이미지와 장면 설명, 카메라 경로를 받아 영상을 만듦
- 직접 프롬프트를 작성하거나, 선택적으로 Qwen3-VL-4B-Instruct를 사용해 이미지 설명을 자동 생성할 수 있음
- 자동 설명은 1인칭 또는 3인칭 장면에 맞춰 작성 가능
텍스트 기반 생성은 원하는 장면을 글로 설명하고 카메라 경로를 지정하는 방식임
여러 시점의 이미지를 입력해 새로운 시점의 영상을 만드는 기능도 지원함
- 공개 데모에서는 프리셋을 고르거나 이미지를 업로드하고, 프롬프트를 수정한 뒤
키보드로 카메라를 조작할 수 있음 - 생성한 영상 조각과 카메라 경로, 세션 메타데이터를 파일로 저장함
— 실행 코드, 데모 안내
Base와 Fast 모델, 공개 범위
WorldCrafter-Base는 140억 매개변수 모델의 기본 Transformer 가중치와 카메라 어댑터, LoRA를 제공함
WorldCrafter-Fast는 적은 추론 단계로 영상을 생성하도록 증류한 모델이며, 인터랙티브 데모에 사용됨
-
논문에서는 GPU 4개 환경에서
초당 16프레임의 생성 속도를 기록함 -
공개 데모는 NVIDIA H200 GPU 1개 및 2개 환경에서 검증됨
-
공식 설치 안내는
Linux·Python 3.11·NVIDIA GPU 환경을 기준으로 하며,uv
또는 Conda로 구성할 수 있습니다.
- Base는 Fast 패키지의 인코더·토크나이저·VAE 등 공용 구성요소를 사용하므로,
Base 실행 시에도 두 모델 폴더를 함께 유지해야 합니다. - 가중치와 추론 코드, 데모 및 서버 인프라는 공개되어 있지만,
사용은 학술 목적에 한정되며 상업적 이용과 프로덕션 배포는 허용하지 않습니다.
— 모델 및 설치 안내, 성능 실험, 라이선스
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기