Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

AgentOPSD는 에이전트 기반 강화학습에서 턴 단위 신용 할당을 위해 비평가(Critic-free) 방식을 사용하는 재귀적 방법론입니다. 희소한 보상을 조밀한 신호로 변환하여 ALFWorld, WebShop 등 다양한 환경에서 기존 GRPO 및 자기 증류 방식을 능가하는 성능을 보여줍니다.

Hugging Face에 학술 지식 그래프 검색 성능을 평가하기 위한 풀 사이클 벤치마크가 출시되었습니다. 실제 쿼리와 API 실행 궤적, 검증된 답변을 포함한 1,133개의 QA 쌍을 제공합니다.
Hugging Face가 서베이 논문을 평가하기 위한 리뷰어 정렬(reviewer-aligned) 벤치마크를 출시했습니다. 이 벤치마크는 실제 동료 심사 보고서를 바탕으로 가독성, 비판성, 포괄성, 구조를 점수화하여 평가합니다.

NVIDIA가 Hugging Face에 NeMo Gym의 대화형 도구 사용(conversational tool-use)을 위한 새로운 자산을 출시했습니다. 이 자산은 골든 정책/도구 참조 쌍과 프롬프트 기록 번들을 포함하고 있습니다.

컴퓨터 사용 에이전트의 궤적을 평가하는 VLM 판사의 신뢰성을 테스트하기 위한 인간-골드 벤치마크인 OSReward를 소개합니다. 상용 모델 대비 비용을 30~60배 절감하면서도 성능이 일치하는 오픈 소스 보상 모델 OS-Shepherd를 제공합니다.

장기적 목표를 수행하는 터미널 에이전트를 위해 재귀적 합성 방식을 제안하는 논문입니다. 기존 고비용 작업 생성 방식과 달리, 난이도를 높여가며 매우 저렴한 비용으로 대량의 에이전트 작업을 생성하는 루프를 검증했습니다.
Tencent Hunyuan3D가 텍스트 프롬프트 하나로 3D 오픈 월드를 생성하는 WorldClaw를 공개했습니다. 에이전틱 플래닝 기술을 통해 지형과 에셋을 세분화하여 탐험 가능한 일관된 장면을 구축합니다.

자율 주행 VLM의 환각 현상을 줄이기 위해 제안된 DEFT-RLVR 연구를 소개합니다. 기존 CoT 방식의 문제점을 해결하기 위해 계획 과정을 다지선다형 궤적 선택 방식으로 재구성하여 성능을 개선했습니다.

ByteDance가 다중 화자 음성 및 오디오 생성을 위한 통합 모델인 SwanTale을 Hugging Face에 공개했습니다. 이 모델은 음성 복제, 자연어 스타일 제어, 음향 장면 합성을 지원합니다.

VAD는 교사 모델의 수정 사항 중 시각적 기여도를 추정하는 반사실적 대상 재구성 알고리즘입니다. 6개의 세밀한 시각적 벤치마크에서 기존의 직접적인 특권 시점 증류 방식보다 우수한 성능을 입증했습니다.

N0-VTLA는 미세한 접촉 조작을 위해 잠재 촉각 토큰을 예측하는 시각-촉각-언어-행동 모델입니다. 9개의 실제 로봇 작업 완수 및 20개의 시뮬레이션 작업에서 63.8%의 성공률을 기록했습니다.

RLVR를 RLSVR로 발전시켜 판사(judge) 없이도 LLM의 자기 개선을 가능하게 하는 새로운 방법론을 제안합니다. '스파이는 누구인가?' 게임을 통해 개방형 작업에서도 검증 가능한 보상을 생성하여 요약, 창의적 글쓰기, 수학적 추론 능력을 향상시킵니다.

MiniMax가 텍스트, 이미지, 비디오, 오디오를 통합 처리하는 옴니모달 생성 시스템인 H3를 Hugging Face에 출시했습니다. 이 모델은 동기화된 스테레오 오디오가 포함된 비디오를 생성할 수 있는 능력을 갖추고 있습니다.

Embodied Manipulation을 위한 데이터를 5개 계층(Real-robot, UMI, Egocentric, Simulation, General)으로 분류하고, 최신 모델들의 데이터 결합 방식을 분석한 종합 서베이 논문입니다.

다인 상호작용 이미지 편집의 한계를 평가하기 위한 새로운 벤치마크인 MPIE-Bench를 소개합니다. 기존 VLM 체크리스트 대신 해부학적 구조와 접촉 기하학을 기반으로 한 새로운 평가 방식을 도입했습니다.

추론 과정에서 메모리를 분리하여 사용하는 사전 학습된 파라미터 기반의 장기 메모리 기술을 소개합니다. 최대 6.9B 파라미터와 300B 학습 토큰까지 확장이 가능한 구조를 가집니다.

Frontis-MA1 (35B) 모델이 MLE-Bench Lite 벤치마크에서 GPT-5.5와 Codex의 성능을 능가했습니다. 이 모델은 OpenMLE 시스템을 통해 학습된 메타 진화 에이전트로, 머신러닝 엔지니어링을 위한 재귀적 자기 개선 능력을 갖추고 있습니다.

자기회귀 비디오 증류 과정에서 발생하는 모드 커버링(Mode Covering)과 모드 시킹(Mode Seeking) 사이의 균형을 맞추는 DistillAlign 기술을 소개합니다. 1.3B 규모의 교사 모델을 활용하여 기존 14B 모델의 정제 파이프라인 성능을 능가하는 효율적인 증류 방식을 제안합니다.

Alibaba가 모바일, PC, 브라우저 및 DeepSearch를 통합하는 GUI 에이전트인 Qwen-UI-Agent를 공개했습니다. 10,000개 이상의 병렬 환경에서 온라인 강화학습(RL)을 통해 학습된 실세계 중심의 파운데이션 모델입니다.

Meta가 화학 연구를 지원하기 위해 AskChem을 Hugging Face에 공개했습니다. 이 모델은 147,000개의 화학 논문을 240만 개의 검색 가능한 주장으로 변환하여 제공합니다.