Hi3D 3.0 (Twinkle3D): 고해상도 객체별 3D 에셋 생성을 위한 시스템
요약
Hi3D 3.0은 객체별 충실도를 목표로 하는 이미지-대-3D 생성 시스템입니다. Twinkle3D를 활용하여 $2048^3$ 해상도의 물이 새지 않는 삼각 메쉬 생성을 구현했습니다. 이 시스템은 높은 정밀도와 표면 품질 문제를 동시에 해결하며, 단일 단계 모델과 개선된 교차 모달 상호작용을 통해 기존 대비 뛰어난 성능을 입증했습니다.
핵심 포인트
- $2048^3$ 해상도의 물이 새지 않는 3D 메쉬 생성 가능
- 재설계된 DiT 아키텍처로 학습 시간을 대폭 단축 (10분 $\rightarrow$ 10초)
- 단일 단계 모델이 기존의 2단계 파이프라인 능가하는 성능 달성
- 교차 모달 상호작용 메커니즘으로 객체별 구조 복구 개선
이미지-대-3D 생성(Image-to-3D generation)은 입력 이미지와 매우 유사한 객체를 생성하는 능력이 점점 향상되고 있으며, 뛰어난 과제는 그 객체 자체를 재현하는 것입니다. 여기에는 객체의 정체성을 결정하는 데 중요한 각인, 브랜드 마크, 반복 구조 등이 포함됩니다. 이러한 요소들은 종종 왜곡되거나 손실됩니다. 우리는 객체별 충실도(object-specific fidelity)를 목표로 하는 이미지-대-3D 생성 시스템 Hi3D 3.0을 제시하며, Twinkle3D를 사용하여 $2048^{3}$ 해상도의 물이 새지 않는 삼각 메쉬(watertight triangle meshes)를 생성하는 기하학 모델로 사용합니다. Twinkle3D는 네 가지 차원에서 고충실도 기하학 생성을 발전시킵니다. 첫째, O-Voxel/FaithC가 높은 표현 정밀도를 제공하지만, 종종 낮은 표면 품질과 비(非)물이 새지 않는(non-watertight) 기하학 문제를 겪습니다. 우리는 $2048^{3}$ 수준의 정밀도를 유지하면서 이 두 가지 문제 모두를 해결합니다. 둘째, 재설계된 DiT 아키텍처와 대규모 분산 학습 최적화를 통해 확산 생성(diffusion generation)을 최대 300K 개의 기하학 토큰 시퀀스로 확장하여, 단계당 학습 시간을 약 10분에서 10초로 단축했습니다. 셋째, 후속적인 정제 과정만으로는 초기 생성 단계에서 발생한 오류를 완전히 보상할 수 없습니다. 따라서 우리는 초기 생성 단계에서 전역 모양(global shape)과 국부 디테일(local detail)을 모두 강화하고, 그 결과 얻은 단일 단계 모델이 $512^{3}$ 정제 과정을 거친 이전의 2단계 파이프라인을 능가합니다. 마지막으로, 우리는 시각적 증거와 기하학 토큰 간의 대응 관계를 강화하는 미세한 이미지-대-3D 교차 모달 상호작용 메커니즘(fine-grained image-3D cross-modal interaction mechanism)을 도입하여 객체별 구조의 복구를 개선합니다. 우리는 실루엣 및 노멀 필드에서 파생된 정렬 측정 지표를 사용하여 기하학적 충실도를 평가했습니다. Hi3D 3.0은 보고된 모든 측정 지표에서 네 가지 상용 시스템보다 우수하며, 가장 강력한 경쟁자가 21.7%의 재현율(recall)을 보인 것에 비해 각인 문자의 82.1%를 98.2%의 정밀도(precision)로 복구했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기