DAGS: 고정된 Image DiT를 활용한 시간적으로 안정화된 생성 렌더링을 위한 분리형 외관 및 기하학적 제어
요약
DAGS는 고정된 Image DiT를 활용하여 외관 및 기하학적 조건을 분리 제어함으로써, 높은 충실도와 독립적인 제어가 가능한 생성 렌더링을 구현합니다. 어텐션 비용을 줄이고 백본 과적합 위험을 제거한 이 방식은 순환 조명 안정화기와 시간적 안내 항을 추가하여 프레임별 이미지 모델을 스트리밍 렌더러로 격상시킵니다.
핵심 포인트
- 외관/기하학 조건을 분리 제어하여 높은 충실도와 독립적인 제어 가능
- 어텐션 비용(quadratic cost)을 피하고 백본 과적합 위험 제거
- 순환 조명 안정화기와 시간적 안내 항으로 스트리밍 렌더러 격상
- 패스 트레이싱 자원으로 고품질의 시간적으로 안정된 렌더링 생성
확산 변환기(Diffusion transformers, DiTs)는 텍스트 및 이미지 조건으로부터 고충실도 이미지를 생성하지만, 그 출력물은 큰 분산을 가지며 원하는 목표에 대한 충실도는 조건이 어떻게 공급되느냐에 크게 의존합니다. 우리는 DAGS를 제안합니다. 이는 경량의 어텐션-프리(attention-free) 방식으로, 외관 및 기하학적 조건을 분리하여 고정된 Image DiT가 고충실도하고 높은 충실도를 가지며 독립적으로 제어 가능한 렌더링을 생성하도록 유도하는 방식입니다. 두 개의 작은 컨볼루션 인코더가 프레임당 한 번 조건화 특징(conditioning features)을 계산하고, 이를 이미지 토큰에 학습된 계층별 요소별 잔차(learned, per-layer, element-wise residual)로 주입하여 어텐션을 통해 조건을 쌓는 이차 비용(quadratic cost)을 피합니다. 제어와 시간적 처리가 고정된 백본(backbone) 외부에 존재하기 때문에, 우리는 그 방대한 사전 학습된 사전 지식(pretrained prior)을 유지하고 백본 과적합 위험(backbone-overfitting risk)을 제거합니다. 나아가 작은 순환 조명 안정화기(recurrent lighting stabilizer)와 훈련이 필요 없는 시간적 안내 항(training-free temporal guidance term)을 추가하여, 이는 우리의 조건화 방식과 결합되어 프레임별 이미지 모델을 스트리밍 렌더러로 격상시킵니다. DAGS는 패스 트레이싱(path tracing)의 일부 컴퓨팅 자원으로 제어 가능하고 고품질의 렌더링을 생성합니다. 실시간은 아니지만, 제어 가능성과 품질을 위해 컴퓨팅 자원을 교환합니다. 매칭된 1-spp + G-buffer 입력에 대해, 프레임별 DAGS는 실시간 디노이저 Intel OIDN 및 확산 렌더러 RGB<->X 대비 +8.6 dB / +10.1 dB PSNR을 재구성하며, 시각적으로 2.5~8배 더 시간적으로 안정적입니다(temporal-LPIPS flicker).
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기