Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
기존의 신경 텍스처 압축 방식은 재질별로 별도의 최적화 과정이 필요했으나, 본 연구는 하이퍼네트워크를 통해 잠재 특징과 MLP 가중치를 동시에 출력하는 방식을 제안합니다. 이를 통해 기존 방식과 대등한 품질을 유지하면서도 효율적인 압축 및 확장이 가능함을 보여줍니다.
희소하고 불완전한 2D 앵커로부터 일관된 3D Gaussian 거리 장면을 생성하는 새로운 연구를 소개합니다. 교사 상대 외관 잔차 증류 기술을 통해 노이즈를 억제하고 뷰 간 일관성을 확보하며, 편집된 뷰에서도 높은 콘텐츠 보존력을 보여줍니다.
경로 추적(Path-traced) 합성 스테레오 데이터에서 두 카메라의 분산 필드가 높은 상관관계를 보인다는 사실을 발견했습니다. 이 상관관계는 시차 추정 모델이 학습 시 활용할 수 있는 일종의 '지름길(shortcut)'로 작용할 가능성이 있습니다.
Wan-Streamer는 실시간 시청각 상호작용을 위해 설계된 엔드투엔드 네이티브 스트리밍 파운데이션 모델입니다. 단일 Transformer 구조를 통해 언어, 오디오, 비디오를 통합 처리하며, 기존 계층형 시스템의 지연 시간과 오류 누적 문제를 해결했습니다.
지속적인 주름을 구현하기 위해 소성(Plasticity)을 모델링하는 최초의 자기지도 학습 기반 신경망 의류 시뮬레이터를 제안합니다. 물리 법칙 기반의 손실 함수와 커리큘럼 학습을 통해 탄소성 재질을 효과적으로 모방합니다.
다중 에이전트 운동 모델의 파라미터를 자동 최적화하는 EvoFlock 연구를 소개합니다. 유전 알고리즘 기반의 역설계 방식을 통해 복잡한 비선형 파라미터 상호작용을 해결하고 원하는 군집 행동을 구현합니다.
불규칙한 3D 객체의 패킹 문제를 해결하기 위해 컨테이너 크기와 객체 포즈를 동시에 최적화하는 미분 가능한 패킹 프레임워크를 제안합니다. 적응형 압착 메커니즘과 텐서 브로드캐스팅을 통해 기존 방식보다 높은 공간 효율성과 빠른 연산 속도를 달성했습니다.
다중 뷰 표면 재구성을 위해 SDF를 확률 과정으로 모델링하는 SSDP(Stochastic Signed Distance Processes)를 제안합니다. 픽셀 색상을 첫 번째 광선-표면 교차에 의한 혼합 분포로 정의하여 표면 재구성과 불확실성 정량화 성능을 높였습니다.
DeepCAD의 기하학적 표현을 넘어 산업 수준의 파라메트릭 피처 모델링을 지원하는 새로운 AI+CAD 데이터 표현 아키텍처를 제안합니다. WHUCAD 데이터셋을 통해 설계 의도와 복잡한 피처 관계를 학습할 수 있는 구조를 제시합니다.
텍스트 임베딩 공간의 정렬 불량 문제를 해결하기 위해 토큰 간 정렬(Token-to-Token Alignment) 프레임워크를 제안합니다. 구조적 정렬과 임베딩 수준의 정렬을 통해 의미론적으로 유사한 개념들이 일관된 위치에 매핑되도록 하여, 이미지 블렌딩과 연속적 편집을 가능하게 합니다.
단 한 장의 인물 사진으로 실감 나는 3D 가우시안 아바타를 생성하는 FiCA 파이프라인을 소개합니다. 비전 파운데이션 모델과 확산 모델을 결합하여 별도의 최적화 과정 없이도 사실적인 아바타를 즉각적으로 생성합니다.
그레이스케일 이미지를 컬러로 변환할 때 텍스트 조건부(Text Conditioning)가 미치는 영향을 정량적으로 분석한 연구입니다. U-Net과 Stable Diffusion 1.5 아키텍처를 비교하여 텍스트 가이드가 이미지 품질 지표를 어떻게 개선하는지 증명했습니다.
WMGen-v1은 단일 이미지와 텍스트를 활용해 물리적으로 타당한 롱테일 공간 데이터를 생성하는 에이전트 기반 월드 모델 프레임워크입니다. LVLM과 LLM을 결합하여 구조화된 장면을 구축하고, 확산 모델을 통해 고품질의 합성 데이터를 생성하여 공간 인지 성능을 높입니다.
TriFlow는 최근접 정점 벡터 필드(NVF)를 활용하여 예술가 스타일의 3D 메쉬 토폴로지를 생성하는 새로운 생성적 접근 방식입니다. 잠재 흐름 매칭(Latent Flow-matching) 모델을 통해 입력 기하학에 최적화된 구조화된 메쉬를 생성하며, 기존 방식 대비 품질과 속도 면에서 뛰어난 성능을 보입니다.
Diffusion Transformers를 기반으로 사용자가 지정한 매개변수에 따라 텍스처를 정밀하게 타일링하는 새로운 프레임워크를 제안합니다. 좌표 변환 RoPE와 분리된 어텐션 마스크를 통해 구조적 충실도와 조명 일관성을 동시에 확보합니다.
VolHuMe는 64개의 RGB 및 32개의 깊이 카메라를 사용하여 캡처한 고품질 4D 인간 스캔 데이터셋입니다. SMPL-X, 고해상도 메쉬, 다중 뷰 이미지 등 광범위한 그라운드 트루스를 제공하며, 기존 데이터셋보다 정밀한 신체 세부 사항을 보존합니다.
MeshFlow는 메쉬의 대칭성을 유지하며 삼각형 수프 형태로 3D 메쉬를 직접 생성하는 새로운 연구입니다. 등변 최적 운송 플로우 매칭을 통해 기존 자기회귀 방식보다 약 18배 빠른 추론 속도와 높은 품질을 달성했습니다.
Arbor는 텍스트 및 이미지 기반 3D 생성 시 공간적 제어를 가능하게 하는 새로운 연구입니다. 제약 메쉬(constraint meshes)를 통해 객체가 존재해야 할 영역, 피해야 할 영역, 접촉해야 할 영역을 명시적으로 지정할 수 있습니다.
텍스트-이미지 모델의 시각적 다양성 부족 문제를 해결하기 위해 '시맨틱 브라우징' 기술을 제안합니다. VLM과 에이전트 워크플로우를 활용하여 사용자가 의미 있는 변동 축을 따라 창의적으로 이미지를 탐색할 수 있도록 돕습니다.
3D Gaussian Splatting(3DGS) 자산과 물리 엔진 간의 표현 차이를 극복하기 위한 새로운 프레임워크를 제안합니다. 3DGS, 메쉬, 유체를 통일된 물리 입자 세트로 변환하여 장면 수준의 복잡한 상호작용을 가능하게 합니다.