Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

AlayaWorld는 실시간 카메라 제어와 프롬프트 전환이 가능한 상호작용형 장기 비디오 세계 모델입니다. 720p 해상도와 24fps를 지원하며, 지속적인 세계 일관성을 유지하는 것이 특징입니다.

Alibaba 연구진이 DiT(Diffusion Transformers) 내 텍스트 템플릿 토큰이 암시적 의미 레지스터 역할을 한다는 사실을 발견했습니다. 이를 통해 객체의 정체성을 유지하면서도 추가 학습 없이 어텐션 연산량을 20% 절감할 수 있는 가지치기 규칙을 제안했습니다.

Microsoft가 Hugging Face를 통해 시각 전용(vision-only) 컴퓨터 사용 에이전트인 Fara1.5-27B를 출시했습니다. 이 모델은 Online-Mind2Web 벤치마크에서 72.3%의 점수를 기록하며 성능을 입증했습니다.

AlayaRenderer-Flash는 텍스트 프롬프트로 제어 가능한 생성형 월드 렌더러입니다. 실시간 상호작용 장면 합성 속도를 기존 0.56 FPS에서 31.54 FPS로 대폭 가속화하여 플레이 가능한 환경을 제공합니다.

NVIDIA가 Hugging Face를 통해 컬러 코드용 AI 프리 디코더를 출시했습니다. 이 모델은 기존 Chromobius 대비 논리적 오류율을 최대 347배 낮추고 디코딩 속도를 7배 향상시켰습니다.

Alibaba가 개발한 실시간 상호작용 월드 모델인 ABot-World-0를 소개합니다. 단일 RTX 5090 환경에서 720p 해상도와 16fps의 속도로 1.2초의 지연 시간을 유지하며 구동됩니다.

HOMIE는 MLLM을 활용하여 인간과 객체 간의 복잡한 상호작용, 로고 부착, 텍스트 충실도 및 다중 뷰 일관성을 갖춘 비디오를 생성하는 기술입니다.

Microsoft가 Hugging Face를 통해 4B 규모의 컴팩트한 텍스트-이미지 생성 및 편집 모델인 Mage-Flow를 출시했습니다. 이 모델은 오픈 시스템에 필적하는 성능을 제공하며 매우 빠른 추론 속도가 특징입니다.

캐릭터 에이전트와 세계 모델이 장기적인 스토리라인에 따라 함께 진화하는 오픈 스키마 프레임워크인 EvolvingWorld를 소개합니다. 57권의 도서와 138K개 이상의 샘플을 통해 학습되었으며, 20개의 지표로 성능을 검증했습니다.
NVIDIA가 Hugging Face를 통해 유전체 파운데이션 모델인 JEPA-DNA를 출시했습니다. 이 모델은 단순한 마스크 언어 모델링을 넘어 DNA의 기능적 의미를 학습하도록 설계되었습니다.

DeepSearch-World는 교사 모델 없이 검증 가능한 환경에서 스스로 경험하며 학습하는 웹 에이전트용 자기 증류 프레임워크입니다. BrowseComp, GAIA, HotpotQA 등 주요 벤치마크에서 기존 오픈 소스 에이전트들을 뛰어넘는 성능을 입증했습니다.

TimeLens2는 비디오 내에서 특정 사건이 발생하는 시점을 예측하는 범용 비디오 시간적 접지(Video Temporal Grounding) MLLM입니다. 4B 및 8B 파라미터 모델로 구성되어 있으며, 7개의 벤치마크에서 397B 규모의 대형 모델을 능가하는 SOTA 성능을 달성했습니다.

GEPO는 이질적인 태스크에서 탐색과 활용의 균형을 맞추기 위해 그룹 엔트로피를 활용하는 GRPO의 경량 확장 버전입니다. 또한 Cura 1T는 재귀적 자기 개선 루프를 통해 의료 벤치마크에서 뛰어난 성능을 보여주는 모델입니다.

SWE-Pruner Pro는 코딩 LLM이 자신의 은닉 상태를 분석하여 토큰을 효율적으로 가지치기하는 기술입니다. 작업 품질을 유지하면서도 최대 39%의 토큰을 절약할 수 있는 효율적인 추론 방식을 제안합니다.

Loopie는 루핑(looping) 메커니즘을 활용한 루프형 Transformer 모델입니다. 이 모델은 20B MoE 구조를 통해 별도의 도구 없이도 IMO 및 IPhO 금메달 수준의 성능을 증명하며, 파라미터 확장보다 루핑이 더 효율적일 수 있음을 보여줍니다.

7B 규모의 소형 모델을 활용하여 32B 모델보다 뛰어난 지식 그래프 구축 성능을 보이는 RAGU 엔진을 소개합니다. 단일 GPU에서 실행 가능하며 오픈 소스로 제공되어 비용 효율성이 매우 높습니다.

Loopie는 20B 파라미터(2B 활성)를 가진 루프형 Transformer 모델입니다. 외부 도구 없이도 2025 IMO 및 IPhO에서 금메달 수준의 성적을 달성하며 강력한 성능을 입증했습니다.

Microsoft가 개발한 Resource2Skill은 튜토리얼 영상, 코드, 기사 등의 리소스를 소프트웨어 에이전트가 즉시 실행 가능한 기술(executable skills)로 변환하는 새로운 프레임워크입니다.

Cura 1T는 인간의 검증을 포함한 재귀적 자기 개선 루프를 통해 모델을 고도화합니다. 이를 통해 6개의 주요 의료 벤치마크 중 5개에서 기존 프런티어 모델들을 능가하는 성능을 보여주었습니다.

본 논문은 단일 이미지로부터 깊이, 법선 벡터, 매팅, 분할 등 여러 정보를 동시에 추출하는 새로운 방법을 제안합니다. 이 방법은 고정된(frozen) 텍스트-이미지 DiT를 활용하며, 각 작업에 필요한 학습 가능한 파라미터가 매우 적다는 것이 특징입니다.