Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Microsoft가 Hugging Face에 RESOURCE2SKILL 데이터셋을 공개했습니다. 이 데이터셋은 튜토리얼 비디오, 코드, 아티클 등을 에이전트가 실행할 수 있는 스킬로 정제한 것이며, 이를 통해 다양한 도메인 태스크 점수를 향상시킵니다.

OvisOCR2는 페이지 이미지를 Markdown으로 변환하는 0.8B 규모의 엔드투엔드 문서 파서입니다. 이 모델은 OmniDocBench에서 96.58이라는 높은 점수로 최고 성능(state-of-the-art)을 달성하며 뛰어난 성능을 입증했습니다.

Harness Handbook은 복잡한 에이전트 코드베이스를 기능별 행동 맵으로 변환하는 도구입니다. 파일 구조가 아닌 시스템의 실제 기능을 중심으로 코드를 정리하여, 모든 행동에 대한 증거와 연결합니다.

Boogu-Image-0.1은 Base, Turbo, Edit 변형을 갖춘 오픈소스 이미지 생성 및 편집 모델 패밀리입니다. 이 모델은 2억 8백만 장의 이미지와 약 $400K 컴퓨팅 자원으로 구축되어 클로즈드 소스 시스템에 필적하는 성능을 제공합니다.

KnowAct-GUIClaw는 장기적인 여러 애플리케이션에 걸친 복잡한 워크플로우를 지원하는 개인 GUI 비서입니다. 이 시스템은 자기 진화 메모리와 기술을 통합하여 사용자가 다양한 앱 환경에서 일관성 있는 작업을 수행하도록 돕습니다.

본 기사는 강화학습(RL) 분야의 최신 연구 동향을 다루며, 1조 개 파라미터 규모에서 검증 가능한 보상 구현에 성공했음을 강조합니다. 또한, 모델이 자발적으로 고급 인지 행동을 개발하는 사례와 Tencent가 출시한 효율적인 MoE 비전-언어 모델 정보를 제공합니다.

함수 호출 구조를 활용하여 코딩 에이전트의 성능을 개선하는 새로운 방법론이 제시되었습니다. 이 기법은 SWE-Bench에서 7B~14B 모델에 평균 +2.8에서 +5.4의 성능 향상을 가져왔으며, 관련 체크포인트와 데이터셋을 Hugging Face에 공개했습니다.

Blind-Spots-Bench는 인간에게는 쉬운 과제(예: 사지 다섯 개 그리기, 단어 찾기 퍼즐)를 최첨단 AI 모델들에게 노출하여 성능의 취약점을 테스트하는 벤치마크입니다. 이 벤치마크는 AI 모델들이 놓치기 쉬운 '사각지대'를 찾아내는 데 중점을 두고 있습니다.

Tencent가 Hugging Face에 Hy-Embodied-VLM-1.0을 공개했습니다. 이 모델은 체화된 에이전트를 위한 효율적인 MoE 비전-언어 모델로, 토큰당 3B 파라미터만 활성화하는 것이 특징입니다. 총 38개 벤치마크 중 19개에서 SOTA를 달성하며 높은 성능을 입증했습니다.

ServiceNow이 장문 시각 문서 이해를 위한 합성 벤치마크인 SynthDocBench를 공개했습니다. 이 벤치마크는 문서의 길이, 레이아웃, 모달리티 등을 독립적으로 조절하여 VLM의 실패 원인을 진단할 수 있게 합니다. 또한 Tencent는 체화된 에이전트를 위한 MoE 기반 비전-언어 모델 Hy-Embodied-VLM-1.0을 출시하며 성능을 입증했습니다.

Tencent가 Hugging Face에 RxBrain이라는 새로운 멀티모달 파운데이션 모델을 공개했습니다. 이 모델은 언어 추론, 시각적 상상력, 그리고 세계 상태 예측 능력을 하나의 프레임워크로 통합한 체화된 인지 기반의 모델입니다.

ACQUIRE는 패치 생성 전 저장소 이해 격차를 식별하고 해결하는 QA 기반 프레임워크로, SWE-bench Verified에서 Pass@1을 최대 4.4% 향상시켰습니다. 또한 Tencent가 RxBrain이라는 체화된 인지 기반 멀티모달 모델을 Hugging Face에 출시했습니다.

AdvancedMathBench는 학부 및 박사 수준의 수학적 증명 생성 및 검증 능력을 평가하기 위한 벤치마크 스위트입니다. 또한, StudioRecon 논문은 낮은 중첩 카메라만으로 배경과 사람을 분리하여 역동적인 4D 인간 장면을 재구성하는 방법을 제시합니다.

ByteDance Seed가 SpectraReward라는 새로운 보상 방식을 공개했습니다. 이 방식은 생성된 이미지 자체에서 사용자의 프롬프트를 역으로 읽어내는 학습 과정 없이도 작동합니다. 이를 통해 별도의 학습이나 선호도 레이블링 작업이 필요 없어 효율적입니다.
StudioRecon은 배경과 사람을 분리하여 단 4개의 낮은 중첩 카메라로 역동적인 4D 인간 장면 재구성을 수행합니다. 비디오 확산 모델, SMPL 제약, 그리고 재귀적 모듈이 결합되어 고품질의 동적 장면 복원이 가능함을 보여줍니다.

ByteDance Seed는 작은 모델의 강화학습(RL) 탐색을 밀집된 암묵적 보상으로 재사용하는 Direct-OPD 기법을 제안합니다. 이 방법을 통해 Qwen3-1.7B와 같은 소형 모델도 적은 자원으로 높은 성능 향상을 달성할 수 있음을 보여줍니다.

Alibaba가 개발한 ABot-N1은 시각 언어 내비게이션 파운데이션 모델입니다. 이 모델은 인지(cognition)와 제어(control)를 분리하여 복잡한 실내외 환경에서 POI 도착률을 35% 향상시켜 77.3%에 도달했습니다.

NVIDIA가 Nemotron-3 Embed 모델을 Hugging Face에 공개했습니다. 이 모델은 8B 파라미터를 가진 최첨단 다국어 텍스트 임베딩 모델로, 검색 및 의미론적 검색(semantic search)에 활용될 수 있습니다.

KronQ는 그래디언트 공분산(gradient covariance)을 도입한 새로운 사후 양자화 프레임워크입니다. 이 프레임워크를 사용하여 Llama-3-70B 모델의 2비트 퍼플렉서티를 7.93으로 달성하며, 기존 GPTQ 방식과 차별화된 성능을 보여주었습니다.

Trust Region Policy Distillation (TOP-D)은 근접 교사(proximal teacher)를 동적으로 구성하여 불안정한 온-폴리시 증류 과정을 안정적인 학습 패러다임으로 전환합니다. 이 방법은 추가 계산 비용 없이 샘플 효율성과 최종 성능을 개선하는 것이 핵심입니다.