Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

기존 AI가 다음 토큰이나 프레임을 예측하는 통계적 모방에 의존하는 것과 달리, Orca는 물리 세계의 숨겨진 '상태(State)'를 예측하는 새로운 접근 방식을 제시합니다. 비디오와 언어적 이벤트를 통해 물리 법칙을 학습함으로써, 별도의 동작 라벨 없이도 행동 능력을 습득할 수 있음을 증명했습니다.
계층형 언어 모델(TLM) 프레임워크를 통해 단일 오픈 웨이트 모델 내에서 공개 기능과 비공개 기능을 분리하는 새로운 아키텍처를 제안합니다. 비밀 키를 사용하여 특정 매개변수 순열을 제어함으로써, 모델의 핵심 가중치를 변경하지 않고도 권한에 따라 계산 그래프를 다르게 유도할 수 있습니다.

NVIDIA가 Hugging Face를 통해 최적화된 Qwen3.6-27B 모델을 출시했습니다. 이 모델은 262K의 긴 컨텍스트를 지원하며, Blackwell GPU에 최적화된 NVFP4 양자화 기술을 적용했습니다.

서울대학교 연구진이 가중치 공간 산술을 활용해 도메인 변화와 작업 지식을 분리하는 DART 기술을 발표했습니다. 이를 통해 단 한 번의 시연만으로 로봇 정책을 새로운 카메라 환경이나 로봇 형태에 빠르게 적응시킬 수 있습니다.

Meta가 Hugging Face를 통해 R3D-Bench를 출시했습니다. 이 벤치마크는 1인칭 시점의 RGB-D 비디오를 활용하여 정량적인 3D 공간 추론 능력을 평가합니다.

DFlash와 DSpark 기술을 통해 LLM 추론 속도를 최대 15배 향상시키는 Speculative Decoding의 최신 연구 동향을 분석합니다. ICML 2026에 채택된 DFlash의 KV Injection 아키텍처와 DeepSeek의 DSpark 프레임워크를 심층 비교합니다.

인간의 지각 방식에 맞춰 멀티모달 모델의 성능을 평가할 수 있도록 교정하는 PerceptionRubrics 방법론을 소개합니다. 기존 평가 방식의 한계를 극복하고 인간의 시각적 인지 특성을 반영하는 데 중점을 둡니다.

2단계 기하학적 정밀화 기법을 활용하여 상세한 3D 모델을 생성하는 기술을 소개합니다. 또한 지속 가능한 LLM 유지 관리형 Markdown 위키 구축 방법론을 다룹니다.

Transformer 모델이 메타 학습을 통해 범용적인 인컨텍스트 학습(In-Context Learning) 능력을 어떻게 습득하는지 분석합니다. 모델이 별도의 파라미터 업데이트 없이도 새로운 태스크에 적응하는 메커니즘을 다룹니다.
우주선의 약한 질감과 조명 변화 문제를 해결하기 위해 기하학 인지 어텐션이 강화된 GAP-GDRNet 프레임워크를 제안합니다. AFR과 PGSA 모듈을 통해 단안 RGB 이미지 기반의 정밀한 6D 포즈 센싱을 구현합니다.
SelectTSL은 멀티모달 프롬프트를 활용하여 복잡한 음향 환경에서 특정 타겟 음원의 위치를 선택적으로 추적하는 새로운 엔드투엔드 아키텍처를 제안합니다. PGSA 모듈을 통해 프롬프트 정보를 임베딩하여 위상 단서를 정제하고, 타겟의 방향과 개수를 동시에 추정합니다.
본 논문은 컴파일러의 최적화 누락 문제를 해결하기 위한 에이전트 기반 패칭 연구를 다룹니다. LLVM 벤치마크를 통해 코딩 에이전트의 패치 생성 능력을 분석하고, 역사적 지식 증강 기술이 일반화 성능을 어떻게 향상시키는지 제시합니다.
개인화된 LLM에서 사용자 메모리가 추론 과정(reasoning trajectory)을 변화시키는 '추론 드리프트' 현상을 분석합니다. 새로운 측정 프레임워크인 DRIFTLENS를 통해 메모리가 유발하는 추론의 발산을 정량화하고, 이를 완화하기 위한 사후 학습 방법론을 평가합니다.
안전 필수 실시간 자율 시스템을 위해 FPGA를 활용한 하드웨어 강제 세만틱 코디네이션 아키텍처를 제안합니다. 소프트웨어 방식의 한계를 극복하기 위해 TB-CSPN 프레임워크를 하드웨어 수준에서 구현하여 결정론적이고 검증 가능한 코디네이션을 제공합니다.
ACID는 월드 모델을 이용한 계획 수립 시 행동 일관성을 확보하기 위한 새로운 프레임워크를 제안합니다. 역역학 모델을 통해 예측된 궤적의 실현 가능성을 검증함으로써, 더 적은 연산량으로도 높은 계획 성능을 달성합니다.
비-맨해튼 환경에서 물리적으로 그럴듯한 3D 실내 장면을 생성하는 새로운 프레임워크 SPG-Layout을 제안합니다. 통계적 사전 정보와 계층적 배치 전략을 통해 기하학적 오류를 최소화하고 의미론적 사실성을 높였습니다.
WorldSample은 실제 로봇의 물리적 롤아웃과 세계 모델(world-model)을 결합하여 데이터 증강을 수행하는 프레임워크입니다. 정책 속도 학습(PPL)을 통해 시각적 환각을 줄이고, 로봇 조작 작업에서 훈련 단계 단축과 성공률 향상을 동시에 달성했습니다.
에이전트 기반 코드 생성 시 도구 추가보다 추론 노력(reasoning effort)을 높이는 것이 첫 시도 성공률을 높이는 데 훨씬 효과적임을 입증한 연구입니다. 실험 결과, 추론 수준을 높였을 때 완벽 실행 비율이 28%에서 89%로 급증했습니다.
VLA 모델의 데이터 부족 문제를 해결하기 위해 물리적 역량과 의미적 정렬을 분리하는 '태스크 불가지론적 사전 학습(TAP)' 프레임워크를 제안합니다. 라벨 없는 데이터를 통해 운동 사전 지식을 먼저 학습함으로써, 훨씬 적은 전문가 데이터로도 높은 성능과 견고함을 달성했습니다.
인간과 AI의 협업 성능이 단순한 인지 능력이나 모델 벤치마크가 아닌, 개인의 인적 자본(협업 특성)에 의해 결정된다는 연구 결과입니다. Polymarket을 활용한 분석 결과, 소수의 사용자는 상호 보완적 추론을 통해 시장 예측 능력을 능가하는 성과를 보였습니다.