Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Sony AI와 KAIST가 새로운 시점 비디오 생성을 위한 MVTrack4Gen 프레임워크를 발표했습니다. 다중 시점 포인트 트래킹을 활용해 3D 재구성 없이도 높은 기하학적 일관성을 달성했습니다. 또한 NVIDIA가 1M 컨텍스트를 지원하는 753B 파라미터 규모의 GLM-5.2 모델을 출시했습니다.

시각적 정보와 코드를 연결하는 멀티모달 코드 지능(Multimodal Code Intelligence)에 관한 조사 연구입니다. 단순 모방을 넘어 GUI, 플롯, 그래픽을 이해하고 실행 가능한 코드를 생성하는 검증 중심의 네 가지 방향성을 제안합니다.

Alibaba가 발표한 Wan-Streamer v0.1은 네이티브 스트리밍 방식의 엔드 투 엔드 대화형 파운데이션 모델입니다. 하나의 트랜스포머가 시각, 청각, 사고 과정을 통합하여 200ms 미만의 초저지연 오디오 및 비디오 응답을 제공합니다.

NVIDIA가 Hugging Face를 통해 로보틱스 학습을 위한 DROID 데이터셋을 공개했습니다. 이 데이터셋은 564개의 장면과 76,000개의 실제 세계 궤적을 포함하며, LeRobot v3.0 형식으로 제공되어 상업적 이용이 가능합니다.

DomainShuttle은 텍스트-비디오 생성 시 피사체를 다양한 도메인으로 이동시킬 수 있는 모델입니다. 참조 기능과 비디오 특징을 분리하여 도메인 내 충실도와 도메인 간 편집 가능성을 동시에 확보했습니다.

OpenThoughts-Agent는 에이전트 모델을 위한 개방형 데이터 큐레이션 파이프라인을 제안합니다. Qwen3-32B를 활용해 벤치마크 성능을 대폭 향상시켰으며, MobileForge를 통해 라벨 없이도 모바일 GUI 에이전트를 학습시키는 기술을 공개했습니다.
NVIDIA가 Hugging Face를 통해 NVFP4 양자화 기술이 적용된 MiniMax-M3 모델을 출시했습니다. 이 모델은 428B 파라미터의 멀티모달 MoE 구조로, Blackwell GPU에서 메모리 효율을 극대화하며 NatureBench를 통해 성능을 검증합니다.

Kuaishou가 개발한 MemGUI-Agent는 자체 메모리 관리 기능을 갖춘 롱-호라이즌 모바일 GUI 에이전트입니다. ConAct 기술을 통해 UI 상태를 구조화된 액션으로 압축하여 프롬프트 폭발 문제를 해결했습니다.

AOHP는 AOSP를 기반으로 에이전트를 OS의 핵심 요소로 격상시킨 새로운 운영체제 환경을 제안합니다. 자연어를 통해 개인화된 앱을 생성하며, 작업 완료율 향상과 토큰 비용 절감, 강력한 보안을 제공합니다.

Kuaishou가 어노테이션 없이 모바일 GUI 에이전트를 학습시키는 MobileForge를 오픈 소스로 공개했습니다. 또한 Qwen은 7개 도메인을 시뮬레이션할 수 있는 언어 세계 모델인 AgentWorld를 출시했습니다.

Qwen이 7개 도메인에서 에이전트를 시뮬레이션하는 최초의 언어 세계 모델인 AgentWorld를 Hugging Face에 출시했습니다. 이 모델은 환경 상태 변화를 예측하는 능력을 테스트하며, 35B 파라미터 규모와 256K 컨텍스트 윈도우를 지원합니다.

Alibaba Qwen 팀이 긴 사고 사슬(CoT) 추론을 통해 7가지 에이전트 도메인을 시뮬레이션하는 네이티브 언어 세계 모델인 Qwen-AgentWorld를 출시했습니다. 이 모델은 1,000만 개 이상의 궤적 데이터로 학습되어 확장 가능한 시뮬레이터 및 에이전트 파운데이션 모델 역할을 수행합니다.

Nature 패밀리 출판물 기반의 90개 과학 태스크를 평가하는 NatureBench를 소개합니다. 최첨단 코딩 에이전트들이 기존 SOTA 결과와 비교 테스트되었으며, 에이전트의 문제 해결 능력을 검증합니다.

Qwen이 AI의 환경 상태 예측 능력을 평가하기 위한 월드 모델 벤치마크인 AgentWorldBench를 Hugging Face에 출시했습니다. 7개 에이전트 도메인을 기반으로 모델의 시뮬레이션 품질과 일관성을 테스트합니다.

KaLM-Reranker-V1은 쿼리와 패시지 계산을 분리하여 속도를 높인 새로운 리랭커 모델입니다. Matryoshka pooling을 활용해 교차 주의 집중 관련성을 유지하며, 0.27B 규모의 Nano 모델로도 대규모 임베딩 모델과 경쟁할 수 있습니다.

OpenRath가 에이전트 시스템을 위한 PyTorch 스타일의 Session 프리미티브를 도입했습니다. Session은 멀티 에이전트 및 멀티 세션 워크플로에서 상태, 샌드박스, 계보를 관리하는 일급 객체 역할을 합니다.

DataClaw0는 비디오, GUI, 임바디드 데이터 등 가공되지 않은 멀티모달 스트림을 정제하기 위한 에이전트 기반 맞춤화 모델입니다. 9B 파라미터 규모로 노이즈를 필터링하고 신호를 조밀한 감독 데이터로 재구성합니다.

GQA(Grouped Query Attention) 구조 상단에 MoE(Mixture-of-Experts) 레이어를 적용한 Grouped Query Experts 기술을 소개합니다. 활성 Query heads를 절반으로 줄이면서도 정확도를 유지하며, 긴 컨텍스트 처리 시 연산량을 효과적으로 절감합니다.

LLM 에이전트의 장기 계획 수립 능력을 평가하기 위한 새로운 벤치마크인 PlanBench-XL을 소개합니다. 도구의 실패나 정보 오류 등 복잡한 상황에서의 에이전트 성능을 측정하며, GPT-5.4 모델의 성능 변화를 분석합니다.

실제 업무 세션 데이터를 기반으로 기업용 코딩 에이전트의 성능을 평가하는 EnterpriseClawBench 벤치마크를 소개합니다. 결과물 전달, 비용, 실행 시간, 기술 전이 측면에서 모델 시스템을 종합적으로 평가합니다.