Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Apple이 기계 번역 모델의 환각 발생 시점을 감지할 수 있도록 대규모 데이터셋인 HAT을 공개했습니다. 이 데이터셋은 38개 언어 쌍에 걸쳐 총 35만 개의 스팬 레벨 주석을 포함하고 있습니다.
NVIDIA가 Hugging Face에 nvDock이라는 확산 모델을 출시했습니다. 이 모델은 모든 원자 분자 포켓 도킹 분야에서 새로운 최고 성능(SOTA) 결과를 달성하며, Top-1 정확도 81.85%를 기록했습니다. 또한 SenseNova-Vision 모델은 컴퓨터 비전과 멀티모달 생성을 통합하여 다양한 시각 작업을 단일 모델로 처리할 수 있게 했습니다.

Microsoft가 연구 방향 검토자(reviewer)를 위한 AI 공동 저자인 ResearchStudio-Idea를 출시했습니다. 이 도구는 1,947편의 주요 학회 논문을 기반으로 하며, 문헌 검색, 내용 확인, 위험 감사 기능을 제공합니다. 이를 통해 사용자는 다양한 아이디어 패턴을 추출하여 연구에 활용할 수 있습니다.

OmniOpt는 현대적 옵티마이저를 위한 통합 분류 체계와 대규모 벤치마크를 제안합니다. 100개 이상의 방법론을 다루며, 60M에서 1B 파라미터 규모의 LLM 사전 학습 과정에서 24개 이상의 옵티마이저를 엄격하게 평가합니다.

NVIDIA가 Hugging Face를 통해 새로운 모델 가중치인 CWIP-1.0을 출시했습니다. PixWorld 기술을 활용하여 픽셀 공간에서 3D 생성과 재구성을 통합하며, 기존 모델보다 최대 1000배 빠른 생성 속도를 자랑합니다.

NVIDIA가 음성, 소리, 추론을 통합 처리하는 30B MoE 모델인 Audex를 Hugging Face에 출시했습니다. 또한 Microsoft는 PDF를 기반으로 비디오와 블로그 등 다양한 콘텐츠를 생성하는 ResearchStudio-Reel을 공개했습니다.

Xiaomi와 Tsinghua 연구진이 멀티 티처 온-폴리시 증류 기술을 적용한 8B GUI 에이전트인 UI-MOPD를 오픈 소스로 공개했습니다. 이 모델은 데스크톱과 모바일 환경 모두에서 뛰어난 성능을 보여줍니다.

Microsoft가 PDF 파일을 기반으로 포스터, 비디오, 블로그, 인터랙티브 릴을 자동 생성하는 ResearchStudio-Reel을 출시했습니다. Claude Code와 Codex 기술을 활용하여 편집 가능한 형태의 결과물을 생성합니다.

AI-Infra-Guard는 에이전트 스택의 각 레이어에 탐지 패러다임을 매핑하는 오픈 소스 레드 티밍 프레임워크입니다. 인프라, 프로토콜, 행동, 모델을 아우르는 포괄적인 보안 검증을 지원합니다.
NVIDIA가 Hugging Face를 통해 고해상도 기후 시뮬레이션 데이터셋을 공개했습니다. SCREAM 모델 기반의 이 데이터셋은 차세대 기상 에뮬레이터 학습을 목적으로 설계되었습니다.

데이터 중심(data-centric) VLM 학습을 위한 대규모 벤치마크인 DataComp-VLM을 소개합니다. 160개의 데이터셋과 6T 토큰을 활용하여 적절한 데이터 혼합이 필터링보다 성능 향상에 더 효과적임을 입증했습니다.

OrbitQuant는 이미지 및 비디오 확산 트랜스포머(Diffusion Transformers)를 위한 캘리브레이션 프리 PTQ 기술입니다. W4A4 환경에서 SOTA를 달성했으며, 기존 방식이 실패하는 W2A4 환경에서도 이미지 생성이 가능합니다.

이질적인 로봇 환경에서 동작하는 Embodied AI 전용 C++ 추론 런타임인 Embodied.cpp를 소개합니다. GGUF 가중치를 활용해 엣지 로봇의 CPU, GPU, NPU에서 VLA 및 world-action 모델을 실행할 수 있습니다. 또한 Tencent의 새로운 대규모 MoE 모델인 Hy3의 출시 소식도 포함되어 있습니다.

Tencent이 Hugging Face에 295B MoE 구조의 Hy3 모델을 출시했습니다. 이 모델은 추론, 코딩, 에이전트 분야에서 강력한 성능을 발휘하며 256K의 긴 컨텍스트를 지원합니다.

Alibaba와 ZJU가 로봇 정책의 성공률을 높이는 경량 플러그인인 VLA-Corrector를 공개했습니다. 이 기술은 시각 역학을 모니터링하여 드리프트 발생 시 즉각적인 재계획을 수행합니다.

Alibaba가 훈련과 추론 사이의 불일치 문제를 해결하기 위한 새로운 강화학습 목적 함수인 MIPI를 소개했습니다. 2단계 MIPU 프레임워크를 통해 추론 정책을 직접 최적화함으로써 LLM 사후 학습의 효율성을 높입니다.

Alibaba Qwen 팀이 VLN, ObjectNav, 트래킹, 자율 주행을 통합 처리하는 2B-8B 규모의 Qwen-RobotNav 모델을 공개했습니다. 에이전트 기반 플래너를 통해 제로샷 방식으로 실제 사족 보행 로봇에 배포가 가능합니다.

PhotoQuilt는 추가 학습 없이 다양한 해상도에서 포토모자이크를 제작하는 기술입니다. 저해상도 레이아웃을 기반으로 FLUX 모델을 사용하여 타일을 업스케일 및 재노이즈하며, 14K 이상의 고해상도에서도 효율적인 확장이 가능합니다.

NVIDIA가 Hugging Face를 통해 미세 조정된 GR00T N1.7 로봇 정책을 출시했습니다. 이 모델은 Panda 팔 조작을 위한 LIBERO 벤치마크를 기반으로 학습되었으며, LeRobot을 통해 배포가 가능합니다.

비디오 MLLM의 시간적-논리적 추론 능력을 평가하기 위한 새로운 벤치마크인 Video-MME-Logical을 소개합니다. 테스트 결과 인간과 AI 모델 간의 극심한 성능 격차가 확인되었습니다.