LoCoSplat: 최소한의 3D 추론을 사용한 실시간 피드-포워드 3D 가우시안 스플래팅
요약
LoCoSplat은 국소적 기본 요소(local primitive) 관점에서 3D 가우시안 스플래팅을 개선한 방법입니다. 이 기술은 무거운 학습된 네트워크 없이도 주변 포인트 클라우드의 국소 평균만으로 깊이 예측 기반의 3D 스테이지 정보를 효과적으로 구현합니다. RealEstate10K 데이터셋에서 기존 방식 대비 우수한 성능과 함께, 빠른 추론 속도와 낮은 메모리 사용량을 입증했습니다.
핵심 포인트
- 학습된 네트워크 없이 국소 평균을 활용하여 3DGS를 개선함.
- RealEstate10K 등 다양한 뷰 수에서 이전 방법보다 높은 PSNR/SSIM 성능 달성.
- NVIDIA RTX PRO 6000 GPU에서 6뷰 장면 재구성을 33ms 만에 완료하는 빠른 속도.
- 추론 메모리 사용량이 기존 기술 대비 현저히 낮아 효율적임.
피드-포워드 3D 가우시안 스플래팅 (3DGS)은 점점 더 많은 학습된 3D 네트워크를 사용하여 다중 뷰 증거를 통합하고 있습니다. 우리는 가우시안이 국소적인 기본 요소(local primitive)라는 관찰에서 영감을 받아 LoCoSplat (Local-Context Splatting)을 제안합니다: 깊이가 예측되면, 3D 스테이지가 추가해야 하는 것(스케일, 회전, 불투명도)은 각 앵커 주변의 포인트 클라우드에 따라 달라지며, 이웃 영역의 고정된 국소 평균만으로 충분하여 무거운 네트워크가 필요하지 않습니다. LoCoSplat은 정확히 이러한 평균을 실현합니다: 이는 포인트 피처의 16차원 선형 투영을 미세하고 거친 그리드(fine and a coarse grid)에 스플래팅한 후, 0.14M 파라미터의 점별 MLP(pointwise MLP)를 사용하여 각 앵커에서 둘 다 읽어옵니다. 학습된 3D 네트워크나 동적 희소 계산 없이, 전체 인코더가 하나의 fp16 CUDA 그래프로 실행됩니다. RealEstate10K 데이터셋에서 LoCoSplat은 6뷰, 12뷰, 24뷰 모두에서 PSNR, SSIM, LPIPS 측면에서 모든 이전 피드-포워드 방법보다 우수한 성능을 보였으며, 뷰가 밀집될수록 그 격차가 벌어지며 (+3.3 PSNR로 24뷰에서 기존의 복셀 정렬 최신 기술인 VolSplat 대비) ACID로의 제로샷 전이(zero-shot transfer) 및 ScanNet에서의 미세 조정 시 더욱 증가합니다. 이 방법은 하나의 NVIDIA RTX PRO 6000 GPU에서 6뷰 장면을 33ms 만에 재구성하며, 이는 7가지 피드-포워드 방법 중 가장 빠르고 이전 최신 기술보다 $4.2 imes$ 더 빠르며, 학습 속도는 $2.7 imes$ (24뷰에서는 $5.9 imes$) 빠르고 추론 메모리는 $6.7 imes$ 적게 사용합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기