Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Xiaomi가 10만 시간 이상의 실제 조작 데이터를 학습한 시각-언어-행동(VLA) 파운데이션 모델을 공개했습니다. 이 모델은 모바일 조작 작업에 즉시 적용 가능한 확장성을 갖추고 있습니다.

잔차 스트림(residual-stream) 확장을 N=4 이상으로 확장한 최초의 HC 계열 방법론인 xHC를 소개합니다. 18B MoE 모델에서 단 4%의 추가 학습 연산량만으로 기존 mHC 대비 평균 4.0 포인트의 성능 향상을 달성했습니다.

이번 주 Hugging Face가 추천하는 논문들을 소개하며, 에이전트 개발, 장문 컨텍스트 처리, 멀티모달 이해 및 생성 등 최신 AI 연구 동향을 다루고 있습니다. 특히 다양한 분야에서 성능 향상을 위한 새로운 모델과 접근 방식들이 제시되었습니다.

본 기사는 AI 에이전트가 자신의 모델 자체나 스캐폴드(프롬프트, 메모리, 도구)를 업데이트하여 스스로 개선하는 방식에 대한 239개의 논문을 조사한 내용을 다룹니다. 이는 자율적으로 진화하는 차세대 에이전트 시스템의 연구 동향을 보여줍니다.

새로운 데이터 엔진이 Black Myth: Wukong 게임 플레이 데이터를 90시간 이상 수집하고 분석했습니다. 이 포괄적인 설문조사 및 벤치마크는 상호작용 가능한 세계 모델을 재고하며, 네 가지 핵심 차원을 깊이 있게 다룹니다.

NVIDIA가 Hugging Face에 Nemotron-3-Embed-1B-NVFP4라는 4비트 양자화 임베딩 모델을 출시했습니다. 이 모델은 높은 효율성을 유지하면서도 99.5%의 검색 정확도를 달성하여, 임베딩 모델 활용 분야에 새로운 기준을 제시합니다.

GigaWorld-Policy-0.5 모델이 로봇 제어에 사용되는 로컬 RTX 4090 환경에서 85ms의 추론 시간을 달성했습니다. 이 모델은 Mixture-of-Transformers 아키텍처를 활용하여 시각적 역학과 액션 생성을 분리함으로써, 실시간 배포가 가능하도록 최적화되었습니다.

CO2Jump는 훈련 과정 없이 작동하는 샘플러로, 생성 과정에서 텍스트와 이미지가 상호 교정되는 기능을 제공합니다. 이 기술은 이미지 편집이나 미로/노노그램 풀이 등 다양한 분야에서 기존 방식보다 뛰어난 성능을 보여줍니다.

UniVR은 언어 감독 없이 순수 시각적 데모만으로 복잡한 추론, 물리 역학, 장기 계획을 학습하는 시스템입니다. ByteDance와 BJTU가 공개했으며, VR-X 벤치마크에서 높은 성능 향상을 보였습니다. 또한 MetaView는 단일 이미지로부터 기하학적으로 일관된 고화질의 새로운 시각적 뷰를 합성하는 확산 기반 프레임워크입니다.

MultiRef-Compass는 다중 참조를 이용한 오디오-비디오 생성에 대한 통합 벤치마크입니다. 또한, Kuaishou의 Kolors 팀과 NTU가 큰 카메라 회전에도 기하학적 일관성을 유지하는 확산 기반의 MetaView 프레임워크를 공개했습니다.

KeyFrame-Compass는 키프레임 조건부 비디오 생성을 평가하기 위한 최초의 종합 벤치마크입니다. 이 벤치마크는 386개의 샘플과 6가지 지표를 제공하며, 증거 기반 품질 평가도 포함합니다. 또한 LLM/VLM 에이전트 역량을 측정하는 AgentCompass도 소개되었습니다.

MetaView는 Kuaishou의 Kolors 팀과 NTU가 공개한 확산 기반 프레임워크입니다. 이 모델은 큰 카메라 회전 하에서도 기하학적으로 일관된 고화질의 새로운 시점 이미지를 합성하는 것을 목표로 합니다.

AgentCompass는 LLM/VLM 에이전트의 역량을 통합적으로 평가하기 위한 인프라입니다. 장애 허용 비동기 런타임과 궤적 분석 기능을 통해 다섯 가지 차원에 걸쳐 20개 이상의 다양한 벤치마크를 지원합니다.

PolicyShiftGuard는 고정된 분류 체계가 아닌 활성화된 정책 위반 여부를 판단하는 모델입니다. 동일한 이미지가 다른 정책 하에서 레이블이 바뀔 수 있음을 보여줍니다. 또한, LongStraw는 제한된 GPU 예산으로 긴 시퀀스의 RL 사후 학습을 효율적으로 수행하는 아키텍처를 제시했습니다.

샤오미 로보틱스가 38B 규모의 자기회귀 월드 파운데이션 모델인 Xiaomi-Robotics-U0을 공개했습니다. 이 모델은 텍스트-이미지, 다중 시점 장면 생성, 체화 전이, 비디오 생성을 통합한 것이 특징입니다. World Arena에서 GPT-Image-2.0보다 뛰어난 성능으로 1위를 차지하며 주목받고 있습니다.

SearchOS-V1은 개방형 영역의 정보 탐색을 위한 시스템 레벨 다중 에이전트 프레임워크입니다. 이 프레임워크는 취약하고 암묵적인 검색 상태를 명시적이고 공유된 상태로 변환하는 것을 목표로 합니다. WideSearch와 GISA에서 높은 F1 지표를 달성하며 성능을 입증했습니다.

World-action models는 작업 실패 상황에서 적대적으로 이동된 행동을 실행할 때 그럴듯한 미래를 상상하는 능력을 보여줍니다. 이 연구는 모델이 단순히 성공적인 시나리오만 예측하는 것이 아니라, 실패 가능성까지 고려하여 현실적인 세계 모델링을 수행함을 제시합니다.

LongStraw는 고정된 GPU 예산 제약 하에서 수백만 토큰 규모의 RL(강화학습) 후 학습을 위한 아키텍처 인식 실행 스택입니다. 전체 시퀀스 대신 짧은 응답 브랜치를 재현하여, 단 8개의 H20 GPU로도 210만 위치에 도달할 수 있게 합니다.

Microsoft가 Hugging Face에 BitNet Embedding 0.6B라는 새로운 텍스트 임베딩 모델을 공개했습니다. 이 모델은 1.58-bit의 압축된 형태로, MTEB v2에서 높은 점수를 기록했으며, 기존 full-precision 대비 CPU 속도가 2배 빠르다는 장점을 가집니다.

VideoChat3는 토큰 효율적인 4B 비디오 MLLM(Multimodal Large Language Model)입니다. 모션, 장편 영상, 시간적 접지 및 라이브 스트리밍 전반에 걸쳐 강력한 성능을 보여줍니다. 이 모델은 Hugging Face를 통해 완전히 공개되었습니다.