Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

NVIDIA의 ZPPO는 소형 모델이 과거의 어려운 질문을 통해 학습할 수 있도록 돕는 새로운 방법론입니다. BCQ와 NCQ를 통해 프롬프트 내에 교사를 유지함으로써 온폴리시 학습을 보존하며, 3B 규모의 VibeThinker-3B 모델은 이를 통해 프런티어 추론 수준의 성능을 달성했습니다.

VibeThinker-3B는 3B 파라미터 규모임에도 불구하고 AIME26과 LeetCode에서 대형 모델을 능가하는 추론 능력을 보여줍니다. Qwen2.5-Coder-3B를 기반으로 커리큘럼 SFT와 멀티 도메인 RL 등을 적용하여 구축되었습니다.

Microsoft가 코딩 에이전트의 효율성을 높이는 4B 규모의 서브 에이전트 FastContext를 Hugging Face에 출시했습니다. 이 모델은 저장소 탐색 부담을 줄여 토큰 사용량을 60% 절감하고 성공률을 높입니다.

JD가 최초의 오픈 실시간 시각-언어 상호작용 모델인 JoyAI-VL-Interaction을 출시했습니다. 이 모델은 8B 파라미터 규모의 비전 우선 모델로, 지속적인 관찰을 통해 발화 시점을 스스로 결정합니다.

HarnessX는 실행 피드백을 통해 프롬프트, 도구, 메모리를 적응시키는 에이전트 하네스 파운드리입니다. MRAgent의 능동적 재구성 메모리 기술을 통해 장기 추론 능력을 향상시키고 토큰 비용을 절감합니다.

Orchestra-o1은 복잡한 옴니모달 작업을 병렬 서브태스크로 분해하는 멀티 에이전트 오케스트레이션 프레임워크입니다. OmniGAIA 벤치마크에서 72.8%의 정확도를 기록하며 기존 오픈 소스 방식보다 10%p 이상 높은 성능을 입증했습니다.

MRAgent는 능동적 재구성을 특징으로 하는 Cue-Tag-Content 메모리 그래프를 제안합니다. 이를 통해 토큰 비용을 절감하면서도 장기 추론 능력을 최대 23% 향상시켰습니다.

Tencent가 Hugging Face를 통해 대규모 양손 로봇 조작 데이터셋을 공개했습니다. 70개 이상의 태스크를 포함한 25만 개 이상의 에피소드와 고충실도 시연 데이터를 제공합니다.

Microsoft가 코딩 에이전트의 효율성을 높이는 FastContext를 Hugging Face에 출시했습니다. 이 모델은 리포지토리 탐색을 전담하여 메인 에이전트의 토큰 사용량을 최대 60% 절감하고 SWE-bench 성능을 향상시킵니다.

APPO는 에이전트 기반 강화학습(RL)에서 미세한 절차적 결정 지점을 분기하여 신용 할당 방식을 개선한 연구입니다. 새로운 분기 점수(Branching Score)를 통해 작은 선택이 최종 결과에 미치는 영향을 정밀하게 분석합니다.

Kling Team이 개발한 OmniDirector는 멀티샷 비디오의 카메라 움직임을 추출하여 이미지에 복제할 수 있는 새로운 프레임워크입니다. 카메라 그리드 표현과 계층적 프롬프트 에이전트를 통해 캐릭터, 동작, 카메라 움직임을 정밀하게 제어합니다.

멀티모달 에이전트가 3D 공간에서 탐색, 조작, 추론을 수행할 수 있는지 평가하는 새로운 벤치마크인 SpatialWorld를 소개합니다. 8개의 시뮬레이터와 760개의 태스크를 통해 현재 모델들의 한계를 측정합니다.

SCAIL-2는 스켈레톤 없이 구동 비디오로부터 직접 캐릭터 애니메이션을 학습하는 새로운 프레임워크입니다. 애니메이션, 교체, 다중 캐릭터 작업을 하나의 프레임워크에서 수행하며 제로샷 동물 구동 및 1인칭 시점 모션을 지원합니다.

Kuaishou가 30B MoE 구조를 가진 Keye-VL-2.0 모델을 Hugging Face에 공개했습니다. 이 모델은 시간 단위 비디오 이해와 코드, 도구 검색 기능을 통합한 내장 에이전트를 갖추고 있어 정교한 비디오 작업에서 강력한 성능을 보여줍니다.

SearchSwarm은 단일 LLM이 장기 계획 과제를 여러 개의 하위 에이전트에게 분해하고, 그들의 결과를 통합하여 높은 성능을 달성하는 방법을 제시합니다. 이는 복잡한 검색 및 추론 작업에서 SOTA를 기록하며, 지능적인 업무 위임 능력을 보여줍니다.

NVIDIA가 별도의 미세 조정 없이 코드를 액션 인터페이스로 활용하는 공간 추론 에이전트 'SpatialClaw'를 공개했습니다. VLM이 Python 코드를 작성하고 지각 도구를 조합하여 스스로 계획을 수정하며 동작하는 것이 특징입니다.

Claw-SWE-Bench는 OpenClaw 스타일 에이전트를 실제 코딩 작업에서 평가하기 위한 최초의 다국어 벤치마크입니다. 또한, Microsoft Research가 소개한 Arbor는 영속적인 가설 트리 정제 방식을 통해 장기 탐색을 누적 학습으로 전환하는 자율 연구 에이전트입니다.

에이전트 벤치마크가 실제 세계의 진화하는 특성을 반영하지 못한다는 문제점을 지적합니다. EvoArena는 터미널, 소프트웨어, 사회적 도메인 전반에 걸쳐 지속적인 진화를 도입하며, 성능 저하 문제를 해결하기 위해 패치 기반 메모리 래퍼인 EvoMem을 제안합니다.

MiniMax MaxProof는 개체군 수준의 테스트 시간 스케일링 프레임워크로, 수학 올림피아드에서 인간 금메달 기준을 초과하는 높은 점수를 달성했습니다. 또한 MiniMax는 109B 모델에 대한 블록 단위 희소 어텐션(Blockwise sparse attention) MSA를 공개하여, 1M 토큰 컨텍스트에서 어텐션 연산량을 크게 줄였습니다.

Microsoft Research Asia가 에이전트의 실제 사용 환경을 반영한 114개의 장기 지평 과제 기반의 WeaveBench를 공개했습니다. 이 벤치마크는 기존 모델들이 결과만으로 평가받아 성능을 과대평가하는 문제를 해결하기 위해, 모든 단계를 감사하는 '궤적 인지형 심사관'을 사용합니다.