Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 생성형 3D 시스템의 자동 평가를 위한 새로운 벤치마크이자 프레임워크인 3D-DefectBench를 소개합니다. 이 벤치마크는 VLM 기반의 3D 결함 탐지 파이프라인을 체계적으로 분석하며, 기하학, 질감, 프롬프트 준수 등 아홉 가지 미세한 결함을 제공합니다. 연구 결과, 모델 선택 외에도 카메라 프로토콜이나 레이블 구성 같은 전체 파이프라인 요인이 성능에 큰 영향을 미침을 보여줍니다.
본 연구는 역렌더링 과정에서 발생하는 재질-조명 모호성 문제를 해결하는 새로운 접근 방식을 제시합니다. 강체 운동(rigidly moving objects)을 하는 물체의 움직임을 활용하여 다양한 빛-표면 상호작용 데이터를 얻고, 이를 통해 분리된 재질과 조명 정보를 재구성할 수 있음을 보여줍니다.
본 연구는 MLLMs가 물리 기반 텍스트 프롬프트를 활용하여 유한 요소 메쉬 정제(FEM meshing)를 위한 제로샷 기하학적 프록시 역할을 할 수 있는지 탐구합니다. GReFEM 프레임워크는 MLLM을 사용하여 응력 임계 영역을 시각적으로 국소화하며, orthoViews 모듈을 도입하여 2D와 3D 기하학 간의 격차를 해소했습니다.
본 논문은 3D Gaussian Splatting (3DGS)과 같은 Novel View Synthesis 방법론이 깨끗하고 일관된 입력 이미지에 의존하는 한계를 지적합니다. 특히, 물리적 센서 결함이나 디지털 오버레이와 같은 '화면 공간 아티팩트'가 존재할 때 발생하는 문제를 해결하기 위한 연구를 제안합니다.
CGGS는 1인칭 시점(ego-centric) 3D 장면 생성 시 발생하는 시점 불일치와 기하학적 왜곡을 해결하기 위한 새로운 텍스트-to-3D 프레임워크입니다. 다중 시점 확산 모델과 기하학적 최적화 기법을 결합하여 일관성 있고 정확한 3D 콘텐츠 생성을 가능하게 합니다.
Wan-Streamer v0.2는 낮은 지연 시간을 유지하면서 출력 해상도를 640x368로 높인 엔드투엔드 시청각 상호작용 모델입니다. 단일 GPU 저지연 경로와 멀티 GPU 컨텍스트 병렬 구조를 통해 실시간 대화에 적합한 고해상도 비주얼 스트림을 지원합니다.
범용 로봇 조작 정책을 체계적으로 평가하기 위한 통합 벤치마크인 RoboDojo를 소개합니다. 시뮬레이션과 실세계 환경을 결합하여 일반화, 정밀도, 장기 실행 능력 등을 종합적으로 검증할 수 있는 프레임워크를 제공합니다.
SceneFrom3D는 실외 3D 장면 생성 시 발생하는 뷰 스케줄링 병목 현상을 해결하기 위해 자동 뷰 스케줄링 프레임워크를 제안합니다. 유향 생성 그래프를 통해 뷰를 자동으로 정의하며, 객체 수준의 제어를 통해 고품질의 기하학적 일관성을 유지합니다.
본 논문은 미분 가능한 빛 전달 기술을 활용하여 눈부심 지수(UGR)를 최적화하는 새로운 프레임워크를 제안합니다. 기존의 이산적인 UGR 공식을 미분 가능한 시그모이드 경계로 대체하여, 경사 기반 역렌더링을 통해 시각적 불편함을 최소화하는 물리적 설계를 가능하게 합니다.
Omnitrees의 세분화 기능을 확장하여 코스닝(coarsening)을 포함한 완전 적응형 압축을 가능하게 하는 새로운 연산을 제안합니다. 웨이브렛(wavelets)을 통합하여 모멘트를 보존하며, 3D 형상 및 밀도 데이터에서 OpenVDB 대비 압축 효율을 획기적으로 높였습니다.
MV-Forcing은 4D 기하학적 브리지를 활용하여 긴 다중 시점 비디오를 생성하는 새로운 프레임워크를 제안합니다. 3D 재구성 모델을 통해 시점 간 기하학적 일관성을 유지하며, 공동 디노이징 방식을 통해 시간적 제약 없이 비디오를 확장할 수 있습니다.
모바일 로봇의 실시간 포인트 스트림 처리를 위한 새로운 공간 데이터 구조인 ECO(Ego-Centric Octree)를 제안합니다. 3D 슬라이딩 윈도우 방식을 통해 계산 및 메모리 효율성을 높이고, KITTI 벤치마크에서 기존 방식 대비 업데이트 시간을 대폭 단축함을 입증했습니다.
3D Gaussian Splatting(3DGS)의 효율적인 압축을 위해 수학적 보장이 가능한 코어셋(Coreset) 기반 프루닝 기법을 제안합니다. 기존 휴리스틱 방식과 달리 렌더링 목적 함수를 보존하는 증명 가능한 중요도 점수를 사용하여, 추가적인 미세 조정 없이도 높은 품질의 압축 성능을 달성합니다.
UniCaMo는 확산 모델의 입력 노이즈를 직접 구성하여 객체 궤적과 카메라 시점을 동시에 제어하는 통합 프레임워크입니다. 3D 기반 모션 일관성 노이즈 공간을 구축하여 별도의 아키텍처 변경 없이도 높은 기하학적·시간적 일관성을 유지합니다.
3D Foundation Models를 활용하여 SfM 과정 없이 고품질 3D Gaussian Splatting 재구성을 수행하는 새로운 방법을 제안합니다. 깊이 가이드 손실 함수와 MLP 기반 포즈 정밀화 모듈을 통해 희소 뷰 환경에서도 빠른 수렴과 높은 품질을 달성합니다.
TemporalGS는 3D Gaussian Splatting(3DGS)의 렌더링 속도를 높이기 위해 시간적 사전 정보(temporal priors)를 활용하는 새로운 연구입니다. 별도의 추가 학습 없이도 타일 기반 소프트웨어 래스터화 과정에서 중복 작업을 줄여 렌더링 성능을 최대 1.48배 향상시킵니다.
3D 포인트 클라우드 분류를 위해 연합 학습(FL)과 지식 증류(KD)를 결합한 멀티 시드 벤치마크 연구를 제시합니다. 연구 결과, 비독립 동일 분포(non-IID) 환경에서 FL의 성능 저하와 증류 과정에서의 레이블 재사용 문제를 지적하며, 레이블 없는 증류(label-free distillation) 사용을 권장합니다.
PixGS는 2D 생성 모델의 시점 불일치와 복잡한 파이프라인 문제를 해결하기 위해 제안된 단일 단계 픽셀 공간 확산 모델입니다. 3D Gaussian Splatting 속성을 직접 디노이징하여 고품질의 3D 에셋을 빠르고 정밀하게 생성합니다.
NeoMap은 사전 학습된 비디오 모델을 미세 조정 없이 사용하여 단일 이미지나 비디오로부터 새로운 시점을 합성하는 training-free 프레임워크입니다. 자연 비디오 데이터 매니폴드 내에서 최적의 솔루션을 찾는 매니폴드 교대 투영 방식을 통해 높은 충실도와 시점 일관성을 달성했습니다.
히치콕의 영화 'Vertigo'를 AI 비디오 확산 모델로 재구성한 연구입니다. 원본 프레임의 2.78%만을 사용하여 프레임 보간을 통해 시퀀스를 예측하며, 생성된 영상이 고전 영화의 규범을 얼마나 충실히 재현하는지 탐구합니다.