Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

FORT-Searcher는 심층 검색 에이전트를 훈련하기 위한 새로운 프레임워크입니다. 이 프레임워크는 데이터 합성 과정에서 네 가지 주요 위험을 제어하여, 모델이 답변을 생성하기 전에 더 오래 검색하도록 강제하는 것이 특징입니다.

Lookahead Sparse Attention을 적용하여 500K 컨텍스트 길이에서 KV 캐시를 90% 이상 절감하는 기술이 소개되었습니다. 이 방법은 모델 크기를 단지 13.5%로 압축하면서도 RULER, LongBench-v2, 그리고 LongMemEval 등 주요 평가 지표에서의 정확도를 유지하거나 개선함을 보여줍니다.

LabVLA는 16가지 로봇 유형에 걸친 10K개 이상의 실험실 장면을 기반으로 구축되었으며, Qwen3-VL 백본과 DiT flow-matching 전문가를 결합했습니다. 이를 통해 LabUtopia에서 71.1%의 성공률을 달성하고 실제 Franka 로봇으로 전이(transfer)할 수 있는 성능을 보여주었습니다.

TRL-Bench는 20개의 이질적인 인코더들을 하나의 공유 인터페이스를 통해 비교 가능한 임베딩 모델로 변환하는 통합 벤치마크입니다. 총 16개 태스크와 87개의 데이터셋을 사용하여 다양한 인코더들의 성능을 공정하게 측정합니다.

ResearchClawBench는 AI 에이전트의 종단 간(end-to-end) 자율 연구 능력을 측정하는 벤치마크입니다. 이 벤치마크는 10개 도메인에 걸쳐 40개의 실제 과제를 제공하며, 원시 데이터만으로 과학적 발견을 재현할 수 있는지 테스트합니다. 현재 최상위 에이전트들의 평균 점수는 100점 만점에 21.5점에 그쳤습니다.

UW, OpenAI 등은 VLM의 공간 추론 능력을 향상시키기 위해 '상상적 지각 토큰(Imaginative Perception Tokens)'을 개발했습니다. 이 토큰은 관점 취하기와 경로 추적 등의 시각적 관점을 텍스트 기반으로 상상하게 합니다. 또한, NVIDIA는 코드를 액션 인터페이스로 활용하는 트레이닝 불필요 공간 추론 에이전트인 SpatialClaw를 공개하며 VLM의 성능을 개선했습니다.

MiniMax가 백만 토큰 컨텍스트 처리를 위한 MSA(Multi-Query Attention)를 공개했습니다. 이 기술은 Index Branch에서 Top-k KV 블록을 선택하고, Main Branch에서 해당 블록에만 어텐션을 수행하는 방식으로 작동합니다.

ICML 연구에서 발표된 Robust-U1은 멀티모달 LLM에 시각적 자가 복구 기능을 제공합니다. 이 모델은 지도 학습, 강화학습(RL), 그리고 두 보기 간의 공동 추론을 활용하여 손상되거나 가려진 이미지 영역의 픽셀과 의미를 스스로 복원하도록 훈련되었습니다.

InterleaveThinker는 다중 에이전트 파이프라인을 활용하여 모든 이미지 생성기를 텍스트-이미지 시퀀스 마스터로 변환합니다. Planner와 critic 에이전트가 협력하며 단계별 지침 개선을 통해, UEval 및 WISE 점수를 크게 향상시키는 성능을 보여주었습니다.

Alibaba가 Z-Reward 프레임워크를 공개했습니다. 이 프레임워크는 27B 교사 모델과 9B 학생 모델을 활용하여 추론(reasoning)을 점수 분포로 내재화합니다. 이를 통해 무거운 추론 비용 없이도 텍스트-이미지 모델의 인간 선호도를 최대 41.3%까지 향상시킬 수 있습니다.

Microsoft Research가 범용 자율 연구 에이전트인 Arbor를 공개했습니다. 이 에이전트는 지속적인 가설 트리 정제 방식을 통해 장기 탐색을 누적 학습으로 전환하는 것이 특징입니다. 6가지 연구 과제에서 Codex와 Claude Code를 능가하며 높은 성능을 입증했습니다.

본 기사는 환경 모델링, 합성, 평가 및 응용에 대한 체계적인 검토를 통해 LLM 기반 에이전트의 진화 과정을 탐구합니다. 상호작용하는 환경을 이해하고 활용하는 것이 에이전트 시스템 구축에 핵심임을 강조합니다.

NVIDIA가 강력한 그래프 트랜스포머 모델인 Contrastive KERMT를 Hugging Face에 공개했습니다. 이 모델은 1,100만 개의 분자 데이터로 사전 학습되어 신약 개발 과정에서 ADMET 속성 예측을 가속화하는 데 사용될 수 있습니다.

본 논문은 Manifold Power Iteration(MPI)을 활용하여 MoE 라우터 가중치를 재설계했습니다. 이 방법은 라우터 가중치가 각 전문가의 최고 특이 방향에 정렬되도록 하여, 전문가 친화도를 더욱 정확하게 반영합니다. 그 결과, 1B에서 11B 매개변수까지 사전 학습 속도가 향상되고 다운스트림 성능도 개선되었습니다.
ByteDance가 이미지 품질 평가를 위한 자체 진화형 비전-언어 모델인 EvoQuality를 Hugging Face에 공개했습니다. 이 모델은 인간의 레이블링 없이도 자신의 예측을 통해 학습하는 것이 특징입니다. 투표(voting)와 GRPO 기법을 활용하여 기존 지도 학습 방식의 한계를 뛰어넘었습니다.

MemDreamer는 장기 비디오 이해를 위해 지각(Perception)과 추론(Reasoning) 과정을 분리하는 새로운 접근 방식을 제시합니다. 이 모델은 4가지 주요 벤치마크에서 SOTA 성능을 달성하며, 인간 전문가와의 격차를 크게 줄였습니다.

Google이 Hugging Face에 DiffusionGemma라는 멀티모달 언어 모델을 출시했습니다. 이 모델은 이산 확산(discrete diffusion) 방식을 기반으로 하며, 병렬 확산을 통해 텍스트를 생성합니다. NVIDIA의 지원을 받아 양자화된 버전도 제공되어 높은 처리 속도를 자랑합니다.

Microsoft Research가 레이블링 없이 에이전트의 성능을 최적화하는 새로운 방법을 제시했습니다. 이 방법은 오직 자체 과거 궤적만을 사용하여 에이전트 하네스를 개선하며, 검증 세트 없이도 SWE-Bench Pro 점수를 크게 향상시켰습니다.

Alibaba가 위성 이미지를 활용해 심리스한 3D 환경을 구축하는 생성형 3D 모델인 ABot-Earth 0.5를 출시했습니다. 3D Gaussian Splatting 기술을 사용하여 실시간 웹 지도 및 UAV 내비게이션 등 임바디드 AI 분야에 최적화되었습니다.

UC Berkeley RDI가 개발한 'Agents' Last Exam'은 55개 산업 분야의 전문 과업을 다루는 벤치마크입니다. 최첨단 에이전트들도 고난도 과업 통과율이 2.6%에 불과할 정도로 매우 높은 난이도를 자랑합니다.