UVFaceFusion: UV 공간 신경 융합(Neural Fusion)을 통한 야생 환경에서의 빠른 다중 뷰 위상학적 일관성 얼굴 재구성
요약
UVFaceFusion은 UV 공간에서의 신경 융합을 통해 야생 환경에서도 일관된 얼굴 기하학을 재구성하는 새로운 프레임워크를 제안합니다. 기존 방식의 위상 최적화 문제를 해결하여 고정된 위상의 고충실도 메쉬를 빠르게 생성합니다.
핵심 포인트
- 정준 UV 공간에서의 신경 융합을 통한 위상 최적화 문제 해결
- 다중 뷰 이미지로부터 고정 위상 메쉬를 직접 샘플링하는 피드포워드 방식
- 단일 RTX 4090에서 16개 뷰 기준 3초 미만의 빠른 재구성 속도
- 다양한 벤치마크 및 야생 환경 데이터에 대한 뛰어난 일반화 성능
할당된 위상(topology)을 가진 고충실도(high-fidelity) 얼굴 기하학을 재구성하는 것은 디지털 아바타 생성 및 애니메이션에 필수적이지만, 기존의 자동화된 방법들은 종종 기하학적 충실도와 야생 환경(in-the-wild)에서의 일반화 성능 사이에서 절충(trade-off)을 해야 합니다. 우리는 일상적인 이미지로부터 다중 뷰(multi-view), 고정 위상(fixed-topology) 얼굴 재구성을 위한 피드포워드(feed-forward) 프레임워크인 UVFaceFusion을 제안합니다. 우리의 핵심 아이디어는 휴리스틱한 위상 최적화(topological optimization)를 정준 UV 공간(canonical UV space)에서의 학습 가능한 신경 융합(neural fusion)으로 대체하는 것입니다. 다중 뷰 이미지가 주어지면, 우리는 먼저 VGGT와 Pixel3DMM을 사용하여 각각 각 뷰의 조밀한 포인트 맵(dense point maps)과 얼굴 UV 대응 관계(facial UV correspondences)를 얻습니다. 그런 다음, 뷰별 포인트 맵을 정준 UV 도메인으로 들어 올리고(lifted), 새로운 마스크 인식 신경 융합 네트워크(mask-aware neural fusion network)와 융합합니다. 이 네트워크는 완전한 UV 공간 포인트 맵을 예측하며, 이로부터 고정 위상 메쉬(fixed-topology mesh)를 직접 샘플링합니다. UVFaceFusion은 Ava-256 데이터셋으로만 학습되었음에도 불구하고, 데이터셋 특유의 외관 및 촬영 조건에 대한 의존성을 줄여주는 정준 UV 공간 기하학-대-기하학(geometry-to-geometry) 융합 덕분에 여러 공개 벤치마크와 야생 환경의 캡처 데이터에 대해 뛰어난 일반화 성능을 보입니다. 다양한 벤치마크에 대한 실험 결과, UVFaceFusion은 단일 RTX 4090에서 16개의 입력 뷰로부터 3초 미만 내에 메쉬를 재구성하면서도 최첨단(state-of-the-art) 재구성 정확도를 달성함을 보여줍니다. 코드는 https://github.com/grignarder/UVFaceFusion 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기