Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

AgentOPSD는 에이전트 기반 강화학습에서 턴 단위 신용 할당을 위해 비평가(Critic-free) 방식을 사용하는 재귀적 방법론입니다. 희소한 보상을 조밀한 신호로 변환하여 ALFWorld, WebShop 등 다양한 환경에서 기존 GRPO 및 자기 증류 방식을 능가하는 성능을 보여줍니다.

Hugging Face에 학술 지식 그래프 검색 성능을 평가하기 위한 풀 사이클 벤치마크가 출시되었습니다. 실제 쿼리와 API 실행 궤적, 검증된 답변을 포함한 1,133개의 QA 쌍을 제공합니다.
Hugging Face가 서베이 논문을 평가하기 위한 리뷰어 정렬(reviewer-aligned) 벤치마크를 출시했습니다. 이 벤치마크는 실제 동료 심사 보고서를 바탕으로 가독성, 비판성, 포괄성, 구조를 점수화하여 평가합니다.

NVIDIA가 Hugging Face에 NeMo Gym의 대화형 도구 사용(conversational tool-use)을 위한 새로운 자산을 출시했습니다. 이 자산은 골든 정책/도구 참조 쌍과 프롬프트 기록 번들을 포함하고 있습니다.

컴퓨터 사용 에이전트의 궤적을 평가하는 VLM 판사의 신뢰성을 테스트하기 위한 인간-골드 벤치마크인 OSReward를 소개합니다. 상용 모델 대비 비용을 30~60배 절감하면서도 성능이 일치하는 오픈 소스 보상 모델 OS-Shepherd를 제공합니다.

장기적 목표를 수행하는 터미널 에이전트를 위해 재귀적 합성 방식을 제안하는 논문입니다. 기존 고비용 작업 생성 방식과 달리, 난이도를 높여가며 매우 저렴한 비용으로 대량의 에이전트 작업을 생성하는 루프를 검증했습니다.
Tencent Hunyuan3D가 텍스트 프롬프트 하나로 3D 오픈 월드를 생성하는 WorldClaw를 공개했습니다. 에이전틱 플래닝 기술을 통해 지형과 에셋을 세분화하여 탐험 가능한 일관된 장면을 구축합니다.

자율 주행 VLM의 환각 현상을 줄이기 위해 제안된 DEFT-RLVR 연구를 소개합니다. 기존 CoT 방식의 문제점을 해결하기 위해 계획 과정을 다지선다형 궤적 선택 방식으로 재구성하여 성능을 개선했습니다.

ByteDance가 다중 화자 음성 및 오디오 생성을 위한 통합 모델인 SwanTale을 Hugging Face에 공개했습니다. 이 모델은 음성 복제, 자연어 스타일 제어, 음향 장면 합성을 지원합니다.
장기적 목표를 가진 에이전트가 경로를 이탈하지 않도록 계획, 실행, 검증 단계를 분리한 새로운 에이전트 런타임입니다. 모델 변경 없이도 WeaveBench에서 Qwen 3.7-Plus의 성능을 51.8%에서 80.7%로 크게 향상시켰습니다.

VAD는 교사 모델의 수정 사항 중 시각적 기여도를 추정하는 반사실적 대상 재구성 알고리즘입니다. 6개의 세밀한 시각적 벤치마크에서 기존의 직접적인 특권 시점 증류 방식보다 우수한 성능을 입증했습니다.

Meshy T2는 Flow matching 기술을 활용하여 아티스트 수준의 3D 메쉬를 생성하는 프레임워크입니다. 기존 자기회귀 방식보다 10배 이상 빠른 속도로 중앙값 6초 만에 고품질 3D 모델을 생성할 수 있습니다.

N0-VTLA는 미세한 접촉 조작을 위해 잠재 촉각 토큰을 예측하는 시각-촉각-언어-행동 모델입니다. 9개의 실제 로봇 작업 완수 및 20개의 시뮬레이션 작업에서 63.8%의 성공률을 기록했습니다.

RLVR를 RLSVR로 발전시켜 판사(judge) 없이도 LLM의 자기 개선을 가능하게 하는 새로운 방법론을 제안합니다. '스파이는 누구인가?' 게임을 통해 개방형 작업에서도 검증 가능한 보상을 생성하여 요약, 창의적 글쓰기, 수학적 추론 능력을 향상시킵니다.

MiniMax가 텍스트, 이미지, 비디오, 오디오를 통합 처리하는 옴니모달 생성 시스템인 H3를 Hugging Face에 출시했습니다. 이 모델은 동기화된 스테레오 오디오가 포함된 비디오를 생성할 수 있는 능력을 갖추고 있습니다.

Embodied Manipulation을 위한 데이터를 5개 계층(Real-robot, UMI, Egocentric, Simulation, General)으로 분류하고, 최신 모델들의 데이터 결합 방식을 분석한 종합 서베이 논문입니다.

다인 상호작용 이미지 편집의 한계를 평가하기 위한 새로운 벤치마크인 MPIE-Bench를 소개합니다. 기존 VLM 체크리스트 대신 해부학적 구조와 접촉 기하학을 기반으로 한 새로운 평가 방식을 도입했습니다.

추론 과정에서 메모리를 분리하여 사용하는 사전 학습된 파라미터 기반의 장기 메모리 기술을 소개합니다. 최대 6.9B 파라미터와 300B 학습 토큰까지 확장이 가능한 구조를 가집니다.

Beacon은 에이전트형 시각적 추론 모델이 도구를 무분별하게 사용하여 자원을 낭비하는 문제를 해결하기 위한 기술입니다. 모드 적응성과 도구 효과를 도입하여 필요한 시점에만 효율적으로 도구를 호출하도록 설계되었습니다.

RAG 시스템의 규모에 따른 검색 성능 변화를 분석한 연구 결과입니다. 데이터 규모가 작을 때는 에이전트 기반 검색이 유리하지만, 약 1,000만 토큰을 기점으로 BM25와 같은 어휘 검색 방식이 성능 면에서 우위를 점합니다.