Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Frontis-MA1 (35B) 모델이 MLE-Bench Lite 벤치마크에서 GPT-5.5와 Codex의 성능을 능가했습니다. 이 모델은 OpenMLE 시스템을 통해 학습된 메타 진화 에이전트로, 머신러닝 엔지니어링을 위한 재귀적 자기 개선 능력을 갖추고 있습니다.

자기회귀 비디오 증류 과정에서 발생하는 모드 커버링(Mode Covering)과 모드 시킹(Mode Seeking) 사이의 균형을 맞추는 DistillAlign 기술을 소개합니다. 1.3B 규모의 교사 모델을 활용하여 기존 14B 모델의 정제 파이프라인 성능을 능가하는 효율적인 증류 방식을 제안합니다.

Alibaba가 모바일, PC, 브라우저 및 DeepSearch를 통합하는 GUI 에이전트인 Qwen-UI-Agent를 공개했습니다. 10,000개 이상의 병렬 환경에서 온라인 강화학습(RL)을 통해 학습된 실세계 중심의 파운데이션 모델입니다.

Meta가 화학 연구를 지원하기 위해 AskChem을 Hugging Face에 공개했습니다. 이 모델은 147,000개의 화학 논문을 240만 개의 검색 가능한 주장으로 변환하여 제공합니다.

CAST는 게임 솔버를 턴 단위 교사로 활용하여 LLM 에이전트의 성능을 개선하는 연구를 제안합니다. 솔버는 에이전트의 상태를 평가하여 승리까지 남은 작업량을 추정하거나 해결 불가능한 상태를 감지하는 역할을 수행합니다.

CoRT는 GRPO의 루브릭 피드백이 모든 토큰에 동일하게 적용되는 한계를 해결하기 위해 토큰 수준의 신용 할당 방식을 제안합니다. 반사실적 재생(counterfactual replay)을 통해 보상을 정교화하여 응답 수준의 성능을 향상시킵니다.

DecoEvo는 답변 생성기와 루브릭 생성기를 동시에 진화시키는 점수 분리형 공동 진화 프레임워크입니다. 5개의 벤치마크와 3개의 LLM 백본을 통해 성능 향상을 입증했습니다.

ClBench-V는 멀티모달 문맥 학습 능력을 평가하기 위한 새로운 벤치마크입니다. 문맥 접지, 새로운 정보 적용, 새로운 지식 학습이라는 세 가지 핵심 차원을 통해 모델의 성능을 측정합니다.

TurboVLA는 RTX 4090 환경에서 단 0.9 GB의 VRAM만으로 32 Hz의 빠른 속도로 동작하는 컴팩트한 시각-언어-행동(VLA) 모델입니다.

Meta와 공동 연구진이 시각-언어 모델(VLM)의 체화된 행동 능력을 평가하는 새로운 벤치마크인 HumanCLAW를 발표했습니다. 연구 결과, 현재의 VLM은 신체에 대한 자기 인식 능력이 부족하여 행동 결정 과제에서 매우 낮은 성능을 보였습니다.

HiFi-UMI는 로봇 없이도 높은 동작 충실도를 구현할 수 있는 휴대용 데이터 생성 시스템입니다. 3mm의 정밀한 말단 장치 정확도와 초광대역 6뷰 센싱을 통해 정교한 데이터 수집 및 재구성을 지원합니다.

에이전트 메모리 내의 암묵적 연관성 사각지대를 평가하기 위한 새로운 벤치마크를 소개합니다. 쿼리와 직접적인 유사성이 낮더라도 작업 수행에 필수적인 메모리 정보를 식별할 수 있는지 측정합니다.

추론 실패 지점이 감지될 때 교사 모델이 개입하여 제어권을 회복하는 새로운 온폴리시 증류 프레임워크인 Relay-OPD를 소개합니다. 이를 통해 모델의 접두사 실패(prefix failure) 문제를 해결하고 추론 성능을 개선합니다.

StateAct는 픽셀 대신 프로그램 상태를 직접 활용하는 코드 우선 방식의 멀티 에이전트 하네스입니다. 작업당 비용을 약 9배 절감하면서도 OSWorld 2.0에서 새로운 SOTA를 달성했습니다.

멀티 에이전트 프로토콜 증류(MAPD)는 증류와 강화학습을 결합하여 구조화된 프로토콜을 중간 표현으로 사용하는 프레임워크를 제안합니다. 이를 통해 에이전트 간의 통신 스타일을 정규화하고 효율적인 상호작용을 도모합니다.

Alibaba Qwen 팀이 온폴리시 확산 증류 과정에서 발생하는 '부정적 분기 비대칭' 문제를 분석했습니다. 이를 해결하기 위해 각 분기를 별도로 감독하는 '양의 방향 매칭' 기법을 제안하여 증류 성능을 개선했습니다.

로봇이 작업 수행 중 최종 성공 여부뿐만 아니라, 자신의 진행 상태(발전, 정체, 퇴보)를 스스로 판단할 수 있도록 하는 진행 보상 모델링(Progress Reward Modeling)에 관한 종합적인 조사 연구입니다.

Kimi K3는 2.8T 파라미터 규모의 MoE 모델로, 1,040억 개의 활성화 파라미터를 사용합니다. 네이티브 시각 능력과 100만 토큰의 긴 컨텍스트 윈도우를 지원하는 개방형 프런티어 지능 모델입니다.

시각-언어 모델의 연산 최적화된 모델 크기와 토큰 수에 관한 체계적인 연구를 다룹니다. 언어 및 멀티모달 목적 함수에 대한 명확한 확장 법칙(scaling laws)을 제시합니다.

에이전트의 메모리 문제는 추론 능력이 아닌 컨텍스트 관리의 실패에서 비롯됩니다. 이를 해결하기 위해 설계, 수집, 범위 지정 등 5가지 프리미티브를 갖춘 ACM 방식을 제안합니다.