Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

RATs는 로봇이 명시적인 지시 없이도 자유로운 놀이를 통해 스스로 과업을 생성하고 기술 라이브러리를 구축하도록 학습시키는 방법론입니다. 강화학습 없이도 코드 기반의 정책을 작성하며, 실제 로봇 팔로의 기술 전이 성능이 뛰어납니다.

촉각 센서 없이 순수한 물리적 접촉만을 활용하여 51자유도의 다지형 손이 서랍과 문을 조작할 수 있도록 학습시키는 새로운 프레임워크인 DragMesh-2를 소개합니다.

ByteDance 연구진이 3D 공간 작업 수행을 위한 공간 에이전트인 S-Agent를 발표했습니다. 이 에이전트는 도구 사용을 통해 접지, 재구성, 추론을 수행하며, 별도의 학습 없이도 GPT-4o와 Gemini 1.5 Pro를 능가하는 성능을 보여줍니다.

Moebius는 0.22B의 적은 파라미터만으로도 SOTA 수준의 인페인팅 성능을 구현할 수 있음을 증명했습니다. FLUX.1-Fill-Dev와 경쟁 가능한 성능을 보이면서도 추론 속도는 15배 더 빠릅니다.

Google이 Hugging Face를 통해 WikiProfile을 출시했습니다. 이 벤치마크는 LLM이 사실 관계를 틀리는 원인이 지식의 부재인지, 아니면 회상 병목 현상 때문인지를 진단합니다.

본 연구는 Flow matching 모델의 현실성 저하 문제를 해결하기 위해 SSL 특징 공간에서 판별기를 학습시켜 강화학습(RL)으로 모델을 가이드하는 방법을 제안합니다. 이를 통해 SiT 모델의 FID를 9.38에서 2.62로 크게 개선하며 시각적 충실도를 높였습니다.

Sparse Autoencoder(SAE)를 이용한 특징 클램핑이 모델의 유해한 행동을 완전히 제거하지 못한다는 연구 결과입니다. 억제된 행동이 재구성 잔차를 통해 높은 확률로 회복됨을 보여주며, 특징 제어와 행동 안전성 사이의 간극을 지적합니다.

FuriosaAI와 UC Berkeley가 개발한 EfficientRollout은 RL 롤아웃을 위한 시스템 인지형 자가 투기적 디코딩 프레임워크입니다. 양자화된 자가 드래프터를 활용하여 모델 품질 저하 없이 롤아웃 지연 시간을 최대 19.6% 단축합니다.

Kairos는 세계 이해, 생성, 행동을 통합한 4B 규모의 네이티브 월드 모델 아키텍처입니다. 하이브리드 선형 어텐션을 사용하여 실시간 엣지 추론이 가능하며, 낮은 연산 비용으로도 14B 모델을 능가하는 성능을 보여줍니다.

RNG-Bench는 최첨단 MLLM이 보이지 않는 정보를 기억만으로 재구성하여 행동할 수 있는지 테스트하는 벤치마크입니다. Matching Pairs와 3D Maze 환경을 통해 모델의 숨겨진 상태 재구성 능력을 평가합니다.

2K 미만의 시뮬레이션 궤적으로 학습된 4B 규모의 오픈 소스 모델인 Guava를 소개합니다. 이 모델은 실제 환경에서 폐쇄형 모델과 대등한 성능을 보이며, 미학습 물체와 장기 작업에 대해 뛰어난 제로샷 일반화 능력을 입증했습니다.

LectūraAgents는 AI 학습에 교수-학생 역학을 도입한 멀티 에이전트 시스템입니다. 개인 맞춤형 교육을 위해 체화된 레슨을 제공하며, ACE-Ego-0 모델을 통해 인간의 비디오를 로봇의 동작으로 변환하는 기술을 선보입니다.
Meta가 Hugging Face를 통해 VLA(Vision-Language-Action) 사전 학습을 위한 LAMP 데이터셋을 출시했습니다. 1인칭 시점의 인간 및 로봇 데이터를 통합하여 로봇의 동작 학습을 지원합니다.

Tencent와 CUHK 연구진이 Godot 엔진 기반의 게임 제작 태스크를 평가하는 벤치마크인 GameCraft-Bench를 발표했습니다. 최첨단 코딩 에이전트들도 41.46%의 낮은 성능을 보여, 완전한 게임 생성 기술의 한계를 확인했습니다.

Ai2가 비디오와 언어 지시문을 통해 3D 포인트 궤적을 예측하는 4B 규모의 비전-언어 모델인 MolmoMotion을 Hugging Face에 출시했습니다. 이 모델은 객체의 시간적 공간 움직임을 예측하는 데 특화되어 있습니다.

ACE-Ego-0는 VLA 사전 학습을 위해 인간과 로봇의 1인칭 시점 데이터를 통합한 모델입니다. 6,000시간 이상의 데이터를 활용해 인간의 비디오를 로봇의 행동으로 변환하며, RoboCasa와 RoboTwin 벤치마크에서 높은 성능을 입증했습니다.
Ai2가 비디오 내 3D 점 움직임을 평가하기 위한 새로운 벤치마크인 PointMotionBench를 Hugging Face에 출시했습니다. 이 벤치마크는 객체별 표면 점 추적 데이터와 인간이 검증한 자연어 캡션을 포함하여 1인칭 및 3인칭 장면을 모두 다룹니다.

Allen AI가 Hugging Face를 통해 T-MAX 15K 데이터셋을 출시했습니다. 이 데이터셋은 14.6k개의 오픈 인스트럭션 예시와 멀티모달 대화, 시각적 환경 및 근거 있는 답변을 포함하고 있습니다.
Ai2가 로보틱스와 1인칭 시점 비디오 분석을 위한 MolmoMotion-1M 데이터셋을 Hugging Face에 출시했습니다. 이 데이터셋은 역동적인 장면을 위한 100만 개의 3D 포인트 궤적을 포함하고 있습니다.

LoopCoder-v2는 18T 토큰으로 학습된 7B 모델로, 단 2번의 루프만으로 SWE-bench Verified에서 64.4점을 기록하며 대형 모델을 능가합니다. 또한 VibeThinker-3B는 3B 파라미터로 AIME26 및 LeetCode에서 압도적인 추론 성능을 보여줍니다.