Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
2026년 상반기 주요 LLM 출시 현황과 기술 트렌드를 분석합니다. Claude Sonnet 5, GPT-5.6, Gemini 3.5 Flash 등 프론티어 모델의 성능과 가격, 그리고 오픈 소스 모델의 급격한 성장을 다룹니다.
3D Gaussian Splatting 환경에서 물리 기반의 정반사를 정확하게 재구성하고 편집할 수 있는 새로운 방법론을 제안합니다. 경로 추적과 특화된 훈련 방식을 통해 반사판과 반사된 객체를 분리하여 모델링하며, 실시간으로 반사 효과를 편집할 수 있습니다.
PolyFlow는 이산적인 메쉬 토폴로지를 연속적인 정점 임베딩으로 변환하여 병렬 생성을 가능하게 하는 플로우 매칭 프레임워크입니다. 기존 자기회귀 방식의 느린 속도를 해결하고, 고품질의 메쉬를 효율적으로 생성하며 해상도를 정밀하게 제어할 수 있습니다.
DANTE-W는 야생 환경의 비정형 이미지로부터 고충실도 확산 알베도 텍스처를 복구하는 신경 텍스처링 프레임워크입니다. 기존 3D 재구성 파이프라인과 통합되어 구워진 셰이딩 문제를 해결하고 물리 기반 신경 렌더링을 통해 미세한 질감을 향상시킵니다.
DualBrep은 CAD 모델링의 B-rep 구조를 처리하기 위해 SDF와 UDF를 결합한 새로운 이중 필드 연속 표현 방식을 제안합니다. 이를 통해 기하 구조와 위상을 단일 잠재 공간에서 통합하여 생성 모델링의 복잡성을 해결하고 정밀한 모델 추출을 가능하게 합니다.
3D Gaussian Splatting의 렌더링 속도와 레이 트레이싱의 장점을 결합한 새로운 레이 트레이서 GRay를 소개합니다. GRay는 기존 3DGRT 대비 최적화 속도를 10배, 렌더링 속도를 4배 향상시켜 3DGS 수준의 빠른 속도를 구현합니다.
LLM을 활용하여 가상 인간의 OCEAN 성격 특성을 모델링하고, 비상 시뮬레이션 내 의사결정에 미치는 영향을 연구했습니다. 성격 프로필이 에이전트의 행동 패턴과 집단적 시뮬레이션 결과에 유의미한 변화를 준다는 것을 입증했습니다.
UniTac은 촉각 이해와 생성을 통합한 최초의 멀티모달 모델(UMM)입니다. 센서와 물체의 속성을 모두 인코딩하는 이중 수준 표현을 통해 비접촉에서 접촉으로의 물리적 상호작용을 효과적으로 모델링합니다.
도구 사용 시 발생하는 오류를 스스로 수정할 수 있도록 학습하는 ReGRPO 프레임워크를 소개합니다. 반성 사고(RoT) 데이터와 그룹 상대적 정책 최적화를 결합하여, 멀티모달 에이전트의 도구 사용 성공률을 크게 높였습니다.
신경망의 중첩(superposition) 문제가 잠재 공간의 기하학적 구조를 손상시키는 문제를 해결하기 위해 희소 오토인코더(SAE)를 활용한 연구입니다. 이를 통해 이미지 표현을 정제하고, Gromov-Wasserstein 최적 운송을 이용해 이미지와 scRNA-seq 데이터를 정렬하는 GW-map 방법론을 제안합니다.
Transformer 모델의 효율적인 미세 조정을 위한 새로운 프레임워크인 Mixture-of-Control(MoC)을 제안합니다. 기존 상태 기반 미세 조정의 블록 간 정보 교환 한계를 극복하기 위해 로컬 및 글로벌 제어 신호를 적응적으로 통합합니다.
장기적 언어 에이전트가 암묵적 월드 모델에서 겪는 급격한 성능 저하 현상을 상전이(phase transition) 관점에서 분석합니다. 특정 임계점에서 상태 부하나 호라이즌의 미세한 변화가 월드 모델의 붕괴를 초래함을 밝혀냈습니다.
VLM이 시각적 모호성을 인식하지 못하고 과도하게 확신하는 문제를 해결하기 위해 시각적 의미 엔트로피(VSE)를 제안합니다. 기존 방식이 텍스트 변화에 민감했던 것과 달리, VSE는 이미지 섭동을 통해 시각적 불확실성을 효과적으로 측정합니다.
LLM을 활용한 인공 군집 지능(Artificial Swarm Intelligence)의 효과를 조사한 연구입니다. GPT-5, Gemini 2.5 Pro, Claude Sonnet 4.5를 대상으로 실험한 결과, 모델 내/간 집계를 통해 추정 오차를 최대 37% 감소시킬 수 있음을 확인했습니다.
Xiaomi-GUI-0는 실제 모바일 환경의 복잡한 상태 변화를 반영하기 위해 설계된 네이티브 멀티모달 GUI 에이전트입니다. 실제 기기 중심의 하이브리드 인프라와 오류 주도형 데이터 플라이휠을 통해 실제 애플리케이션에서의 실행 안정성을 극대화했습니다.
동결된 LoRA 어댑터들을 효율적으로 결합하기 위한 2단계 프레임워크인 Hard-Routed MoR-LoRA를 제안합니다. 하드 top-1 라우팅을 통해 각 전문가의 특성을 보존하면서도 적은 파라미터로 멀티 도메인 적응 성능을 극대화합니다.
동적 시나리오에서 발생하는 클래스 불균형과 지속적인 도메인 변화 문제를 동시에 해결하기 위한 새로운 TTA 방법론인 BP-TTA를 제안합니다. 배치 균형 샘플링과 프로토타입 가이드 적응을 결합하여 온라인 업데이트의 안정성과 의사 라벨의 신뢰성을 높였습니다.
단일 단계 비디오 객체 검출기가 실제 시간적 문맥을 활용하는지 진단하는 TemporalLens 프레임워크와 시공간 정보를 보존하는 YOLO-3D 아키텍처를 제안합니다. 실험을 통해 모델이 단순히 프레임 정보를 이용하는지, 아니면 시간적 의존성을 통해 추론하는지를 정량적으로 분석합니다.
언어 에이전트의 월드 모델 드리프트 문제를 해결하기 위해, 행동 전 환경에 질문하여 모델을 보정하는 예산 기반 탐색 기법을 제안합니다. 신념의 유형에 따라 효율적인 탐색 전략을 다르게 적용하여 작업 수행 중 발생하는 오류를 최소화합니다.
감정 감지 AI가 확산됨에 따라 발생하는 '인식론적 격차'와 감정 해석의 주권 문제를 다룹니다. AI의 측정 한계로 인해 발생하는 의미의 불확실성을 분석하고, 감정의 최종 해석 권한이 주체에게 있어야 한다는 '정동적 주권' 개념을 제안합니다.