Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Gaussian-Enhanced Surfels(GES)의 에일리어싱과 재구성 문제를 해결하기 위해 Depth Peeling을 활용한 DP-GES 방식을 제안합니다. 이 방식은 정렬 없이도 정확한 픽셀 순서와 투과율 변조를 가능하게 하여 고품질의 렌더링을 구현합니다.
자연어 지시로 물리 기반 휴머노이드를 제어하는 다단계 학습 프레임워크 SCRIPT를 제안합니다. JAST-DiT를 통해 언어와 제어 역학을 통합하고, RLHR 사후 학습을 통해 동작 품질과 지시 이행 능력을 극대화했습니다.
3D Gaussian Splatting의 렌더링 지연 시간을 줄이기 위해 Tensor Cores를 활용하는 TensorGS 프레임워크를 제안합니다. 기존 CUDA 코어 중심의 래스터화 방식을 Tensor Core에 적합한 행렬 연산으로 변환하여 성능을 최적화했습니다.
PointLLM-R은 3D 포인트 클라우드 이해를 위해 Chain-of-Thought(CoT) 추론 능력을 도입한 연구입니다. 데이터 중심 프레임워크를 통해 고품질의 PoCoTI 데이터셋을 구축하여 3D 멀티모달 모델의 추론 성능을 극대화했습니다.
BodyReLux는 시간적 일관성을 유지하며 전신 비디오를 재조명하는 새로운 비디오 확산 기반 프레임워크입니다. 새로운 동적 퍼포먼스 캡처 방식과 조명 토큰화 기술을 통해 사실적인 조명 제어를 구현합니다.
moveEZ는 범주형 변수의 수준 변화에 따른 다변량 구조의 진화를 애니메이션화된 PCA biplot으로 시각화하는 R 패키지입니다. 고정 및 동적 프레임워크를 통해 샘플 위치와 변수 벡터의 변화를 효과적으로 보여줍니다.
본 연구는 포즈만으로는 설명하기 어려운 헐렁한 옷의 움직임과 관성을 구현하기 위해 '역학 잔차 잠재 변수(Dynamics Residual Latent)'를 도입한 3D 가우시안 아바타 기술을 제안합니다. 트랜스포머 기반 디코더를 통해 물리적 힘(구동력, 복원력, 소산력)을 모델링함으로써, 추가적인 시뮬레이션 비용 없이도 시간적으로 일관되고 사실적인 전신 아바타 애니메이션을 생성합니다.
PolycubeNet은 복잡한 CAD 기하학적 구조로부터 육면체 메쉬를 자동으로 생성하기 위해 제안된 이중 잠재 확산 모델(Dual-latent Diffusion Model) 기반의 프레임워크입니다. 기존 방식의 한계인 복잡한 표면 분할 과정 없이, 저차원 잠재 공간을 활용하여 계산 효율성을 높이면서도 고품질의 polycube 구조를 생성합니다. 실험을 통해 임의의 종수를 가진 복잡한 모델에서도 견고하고 빠른 생성 성능을 입증하였습니다.
PiG-Avatar는 기존 Gaussian avatar 방식이 가진 신체 템플릿 의존적 기하학 제약을 해결하기 위해 제안된 새로운 방법론입니다. 파라메트릭 신체 모델을 운동학적 전달 용도로만 제한하고, avatar를 연속적인 neural field로 제어되는 볼륨형 정준 공간의 Gaussians로 표현하여 복잡한 의류와 비강체 움직임을 정교하게 캡처합니다. 이를 통해 고충실도의 렌더링 품질과 실시간 성능을 동시에 달성했습니다.
TelePhysics는 단일 이미지로부터 물리적으로 일관되고 제어 가능한 다중 객체 장면을 생성하는 training-free 프레임워크입니다. 통합된 공간 좌표계를 통해 객체 간의 침투 및 정렬 문제를 해결하며, 시뮬레이션과 렌더링을 분리하여 실시간 물리 상호작용과 높은 시각적 충실도를 동시에 달성합니다.
PaintCopilot은 목표 이미지를 미리 설정하는 대신, 캔버스의 상태와 이전 붓터치 이력을 바탕으로 다음 붓터치를 예측하는 자기회귀 방식의 공동 창작 페인팅 어시스턴트입니다. ViT 기반의 Target Predictor, Flow Matching 기반의 Next Stroke Predictor, VAE 기반의 Region Sampler라는 세 가지 모델을 통해 예술적 역학을 학습하고 구현합니다. 이를 통해 예술가와 AI가 창작 과정에서 제어권을 유연하게 주고받으며 협업할 수 있는 워크플로우를 제공합니다.
ROAR-3D는 단일 이미지 기반 3D 생성 모델의 한계를 극복하기 위해, 포즈 정보가 없는 임의의 다중 시점 이미지를 수용할 수 있는 경량 방법론입니다. 토큰 단위 뷰 라우터와 이중 스트림 어텐션 설계를 통해 방향 제어와 기하학적 전이 간의 충돌을 해결하며, 최소한의 파라미터 추가만으로 고품질의 3D 생성을 구현합니다.
AnyAct는 비인간 캐릭터의 단안 비디오에서 동작을 추출하여 인간의 퍼포먼스로 재해석하는 새로운 인간 재연(Human Reenactment) 기술을 제안합니다. 기존 방식의 한계를 극복하기 위해 희소한 국소 2D 관절 동작을 활용하여 캐릭터의 역학을 보존하면서도 편집 가능한 인간 동작을 생성합니다. 이를 위해 3D-to-2D 투영 감독, 점진적 학습, 전역-국소 동작 디커플링이라는 세 가지 핵심 설계를 도입했습니다.
PiG-Avatar는 기존 가우시안 아바타 방식이 가진 신체 템플릿 의존성 문제를 해결하기 위해 연속적인 신경장(Neural-Field) 가이드 기반의 볼륨형 정준 공간을 제안합니다. 이를 통해 의류나 신체 외부 요소와 같은 복잡한 비강체 기하 구조를 템플릿의 제약 없이 정교하게 캡처하며, 실시간 렌더링과 높은 재구성 품질을 동시에 달성합니다.
GLUT는 3D 가우시안 프리미티브를 사용하여 색상 변환을 모델링하는 연속적이고 명시적인 색상 표현 방식입니다. 기존 그리드 기반 LUT의 메모리 문제와 암시적 신경 표현의 해석 가능성 문제를 동시에 해결하며, 컴팩트한 메모리 사용량과 유연한 표현력을 제공합니다. 또한 조건부 생성기(CGLUT)를 통해 매끄러운 스타일 블렌딩과 국소적인 색상 편집을 지원합니다.
WorldParticle은 단일 Transformer 아키텍처를 사용하여 천, 유체, 고체 등 다양한 물리 현상을 통합적으로 모델링하는 학습 기반 입자 시뮬레이터입니다. 예측-수정(prediction-correction) 설계를 통해 입자 간 상호작용을 정밀하게 예측하며, 슈퍼 토큰(super token) 기술을 활용해 계산 효율성을 높였습니다. 이 모델은 학습되지 않은 재료나 경계 조건에서도 뛰어난 일반화 성능을 보여줍니다.
본 연구는 NURBS 곡선 및 패치와 같은 곡면 기하학에서 일반화된 와인딩 넘버(GWN)를 빠르고 정확하게 계산하는 새로운 방법을 제안합니다. 기존의 공간 인덱스 기반 근사 방식이 이산적 데이터에 국한되었던 한계를 극복하기 위해, BVH와 적응형 세분화 전략을 결합하여 경계 근처의 정확도를 유지하면서도 하선형 복잡도를 달성했습니다.
MMGS는 3D Gaussian Splatting(3DGS)의 방대한 데이터 오버헤드 문제를 해결하기 위해 Optimal Transport(OT) 기반의 집계 방식을 제안하는 프레임워크입니다. 다중 뷰 기여도 순위 지정과 전역적 기하학적 분포 매칭을 통해 중복된 프리미티브를 효과적으로 병합합니다. 이를 통해 기존 방식 대비 프리미티브 사용량을 10%로 줄이면서도 최첨단 렌더링 품질과 10배 빠른 학습 속도를 달성했습니다.
본 논문은 삼각형 메시 상에서 삼각분할 방식에 구애받지 않고 신호를 생성할 수 있는 Triangulation-Agnostic Flow Matching(FM) 기법을 제안합니다. Matérn 프로세스를 활용한 특정 가우시안 랜덤 필드 노이즈를 통해 메시의 구조적 변화에도 일관된 성능을 유지하며, PoissonNet을 디노이저로 사용하여 고품질의 신호 생성을 구현합니다.
CompoSE는 부품 인식 제어를 통해 3D 형상을 구성적으로 합성하고 편집할 수 있는 새로운 방법론입니다. 경계 상자와 같은 거친 기하학적 기본 도형을 입력받아 부품 분리형 3D 객체를 생성하며, 디퓨전 트랜스포머 아키텍처를 통해 국소적 편집과 전역적 문맥 정보를 동시에 처리합니다. 텍스트 프롬프트 없이도 레이아웃 가이드를 통해 부품의 의미와 대칭성을 추론하여 정교한 편집 기능을 제공합니다.