Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
AnySurf는 방향성 에지(Directed Edge)를 활용하여 개방형, 폐쇄형 및 하이브리드 3D 표면을 생성하는 통합 프레임워크입니다. 기존 방식의 한계인 법선 및 위상 오류를 해결하며, 의류와 액세서리를 아우르는 범용적인 3D 생성 성능을 보여줍니다.
BrickAnything은 3D 형상으로부터 물리적으로 조립 가능한 브릭 구조를 생성하는 기하학 조건부 자기회귀 프레임워크입니다. 구조 인식 트리 토큰화를 통해 브릭 간의 의존성을 모델링하며, 물리적 안정성과 기하학적 충실도를 동시에 확보합니다.
비디오 확산 모델의 KV 캐시 양자화 시 발생하는 'Jensen 편향' 문제를 분석하고 이를 해결하는 수정 방식을 제안합니다. 2차 테일러 근사를 통해 추가 오버헤드 없이 양자화 노이즈를 제거하여 메모리 사용량을 50% 절감하면서도 고품질 비디오 생성을 가능하게 합니다.
Garment Particles는 2D 재단 패턴과 3D 기하 구조를 동시에 인코딩하는 5D 포인트 클라우드 표현 방식을 제안합니다. 이를 통해 텍스트나 이미지 기반의 직관적인 의류 생성부터 정교한 패턴 편집까지 통합적으로 지원하는 정류 흐름 프레임워크를 구축했습니다.
곡면 위에서 편미분 방정식(PDEs)을 해결하기 위한 메시 프리(mesh-free) 프레임워크인 PINNSur을 제안합니다. 신경장을 통해 곡면의 법선을 학습하고 투영을 활용하여 미분 연산자를 표현하며, PINNs의 수렴 동작을 경험적으로 조사합니다.
DinoComplete는 DINO 특징에서 추출한 의미론적 사전 지식과 상태 공간 모델(SSM)을 결합하여 3D 형상을 완성하는 프레임워크입니다. Mamba 모듈을 통해 효율적인 장거리 추론을 수행하며, 기존 방식보다 적은 파라미터와 메모리로도 뛰어난 완성 품질을 보여줍니다.
본 논문은 GPU 기반의 포워드 경로 추적(PT)과 웨이브프런트 경로 추적(WPT) 알고리즘의 성능을 비교 분석합니다. 연구 결과 WPT가 개선된 캐시 지역성을 바탕으로 PT 대비 약 16%의 성능 향상을 보임을 확인했습니다.
MIND는 텍스트 명령을 통해 물리 기반 휴머노이드를 제어하는 새로운 엔드투엔드 확산 프레임워크입니다. 다중 스케일 의도 확산 메커니즘을 통해 텍스트와 저수준 동작 사이의 모달리티 격차를 해소하고 자연스러운 동작 합성을 구현합니다.
CrossLift는 2D 텍스트-이미지 사전 지식을 활용하여 3D 메시 상의 크로스 필드를 계산하는 기술입니다. 픽셀별 방향을 메시 표면으로 역투영하고 신뢰도 기반 가중치 보간을 통해 가려진 면까지 매끄러운 필드를 생성합니다.
VectorArk는 실제 환경의 이미지에서도 견고한 벡터화를 수행하는 새로운 VLM 기반 모델입니다. 둥근 다각형 표현 방식을 통해 시각적으로 매끄러운 프리미티브를 생성하며, 열화 모델을 도입하여 다양한 입력값에 대한 일반화 성능을 높였습니다.
SMPL 스켈레톤 데이터와 Laban Movement Analysis(LMA) 기술자를 활용하여 3D 가상 환경 내 암시적 동작을 탐지하는 연구를 제시합니다. 4단계 동작 분류 파이프라인을 통해 SFW/NSFW 이진 분류에서 78.7%의 정확도를 달성했습니다.
인간 동작 확산 모델에서 동작의 강도를 정밀하게 제어하기 위한 EMA(Effort Metric Attention) 프레임워크를 제안합니다. LMA 이론을 바탕으로 수치화된 노력 신호를 사용하여 동작의 페이싱과 양을 효과적으로 조절합니다.
SRUG는 그림자를 활용해 보이지 않는 영역의 기하 구조를 복원하고 재조명 가능한 도시 장면을 생성하는 새로운 프레임워크입니다. 대규모 재질 모델(LMM)과 반복적 재질 분해 방식을 통해 복잡한 도시 환경의 조명과 재질을 정밀하게 모델링합니다.
Φ-Noise는 추가 학습 없이 참조 비디오의 저주파 위상 정보를 확산 노이즈에 직접 주입하여 동작을 제어하는 새로운 비디오 컨디셔닝 기법을 제안합니다. 모델 구조 변경 없이도 비디오의 외형과 역학을 효과적으로 제어할 수 있는 효율적인 접근 방식입니다.
다중 뷰 데이터나 중간 뷰 생성 없이 단일 2D 이미지로부터 일관된 3D Gaussian 헤드 아바타를 생성하는 MVCHead를 제안합니다. 계층적 상태 공간 모델(HiSS)과 SE(3) 다중 뷰 크리틱을 통해 높은 지각 품질과 기하학적 일관성을 달성했습니다.
얼굴 스케치를 기반으로 3D 모델을 생성하기 위해 CNN, 파라메트릭 모델, Contour Mapping을 결합한 새로운 연구를 제시합니다. CNN으로 스케치 내 표정을 탐지하고, 이를 3D 모델에 반영한 뒤 Active Snake Contours로 정밀하게 조정하는 방식입니다.
제한된 정보 예산 내에서 단일 스냅샷으로 고품질 역렌더링을 수행하는 새로운 편광 디스플레이 방식을 제안합니다. LCD와 편광 카메라를 결합하여 분광-편광 측정을 수행하며, 트랜스포머 모델을 통해 픽셀 단위의 물리적 속성을 정확히 추정합니다.
F-RNG는 희소한 입력 뷰로부터 재조명 가능한 3D 가우시안 에셋을 직접 생성하는 피드포워드 프레임워크입니다. LRM과 IDM의 사전 지식을 활용하여 기하학적 표현을 강화하고 조명 분리가 가능한 외관을 추출합니다.
이산적 특성으로 인한 부정확성을 해결하기 위해 메시와 포인트 클라우드를 위한 새로운 연속 도메인 곡선 스켈레톤화 프레임워크인 CSCD를 제안합니다. CSCD-M과 CSCD-PC는 기존 방식보다 노이즈에 강하며 위상 보존 능력이 뛰어납니다.
3D 시점 합성 품질과 효율성을 높이기 위해 시점 의존적 2D 커널을 자동으로 학습하는 미분 가능한 프레임워크를 제안합니다. 투영 네트워크와 디코더를 통해 타원체 기반의 방사 대칭 2D 커널을 생성하며, 기존 최신 기술 대비 우수한 성능을 입증했습니다.