Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

ByteDance가 Hugging Face에 계층적 AI 안전 벤치마크인 SafePyramid를 출시했습니다. 이 벤치마크는 인컨텍스트 정책 가드레일링 성능을 측정하며, 최신 모델들의 정책 준수율이 급격히 하락함을 보여줍니다.

ByteDance Seed 팀이 저렴한 인간 영상을 로봇 동작으로 변환하는 새로운 기술을 발표했습니다. 노이즈가 많은 6DoF 손 포즈 대신 상대적 손목 이동을 사용하여 인간과 양팔 로봇 간의 공유된 액션 공간을 구축했습니다.

Peking University와 NVIDIA가 개발한 PhysisForcing은 로봇 비디오 생성을 물리적으로 타당하게 만드는 플러그 앤 플레이 학습 프레임워크입니다. 추가적인 추론 비용 없이도 주요 벤치마크에서 성능 향상을 입증했습니다.

Kuaishou의 Kling 팀이 개발한 UnityShots는 일관된 멀티샷 오디오-비디오 생성을 위한 메모리 구동 시스템입니다. LTX-2.3을 기반으로 하며, 메모리 슬롯을 통해 샷 간의 정체성과 세계관을 유지합니다.

Alibaba Qwen 팀이 훈련 없이 추론 성능을 높이는 'Confident Decoding' 기술을 발표했습니다. 최종 레이어의 정렬 세금을 우회하여 가장 확신 있는 표현을 선택함으로써, 낮은 지연 시간 오버헤드로 큰 추론 이득을 얻을 수 있습니다.

BioMatrix는 서열, 구조, 언어를 통합적으로 처리하는 최초의 생물학적 파운데이션 모델입니다. 단일 디코더 아키텍처를 통해 분자와 단백질을 공유 토큰 공간으로 매핑하며, 80개 태스크 중 77개에서 SOTA를 달성했습니다.

GUI 에이전트와 CLI 에이전트의 성능을 440개의 데스크톱 작업을 통해 비교 분석한 연구입니다. GUI 에이전트는 초기 성능은 높으나 장기 상호작용에 취약하며, CLI 에이전트는 기술 증강을 통해 더 높은 성능을 달성할 수 있음을 보여줍니다.

정답 레이블 없이 시각적 추론을 수행하는 V-Zero 모델을 소개합니다. 대조적 증거 게이팅과 온-정책 증류 기술을 결합하여 기존 SFT나 RL 방식보다 훨씬 빠른 학습 속도를 구현했습니다.

JetSpec은 인과적 병렬 트리 초안 작성(Causal Parallel Tree Drafting)을 통해 추측적 디코딩의 한계를 극복한 새로운 방법론입니다. 단 한 번의 순방향 패스로 토큰 트리를 생성하여 수학 분야에서 최대 9.64배의 속도 향상을 달성했습니다.

EvoEmbedding은 잠재 메모리 큐를 활용하여 긴 문맥 검색을 위한 동적 표현을 생성하는 진화 가능한 임베딩 모델입니다. 자신보다 3배 큰 정적 전문 모델보다 뛰어난 성능을 입증했습니다.

단 한 번의 순전파로 수십 페이지를 전사할 수 있는 새로운 OCR 작동 방식을 소개합니다. 참조 슬라이딩 윈도우 어텐션을 활용하여 효율적인 메모리 관리를 구현했습니다.

CLI-Universe는 실제 세계의 데이터를 기반으로 검증 가능한 터미널 에이전트 태스크를 생성하는 엔진입니다. 이를 통해 미세 조정된 Qwen3-32B 모델은 적은 데이터로도 대규모 모델을 능가하는 성능을 보여주었습니다.

ICWM은 로봇이 새로운 카메라 환경이나 형태에 즉각 적응할 수 있도록 돕는 인컨텍스트 월드 모델링 기술입니다. 별도의 파인튜닝 없이 단 몇 초간의 상호작용만으로 월드 다이내믹스를 학습하여 제로샷 일반화를 구현합니다.

월드 모델, 비디오 생성, 시각-언어-행동 정책(VLA)을 하나의 체계로 통합하여 분석한 서베이 논문입니다. 예측된 미래를 실제 행동으로 연결하는 100개 이상의 방법론을 구조화된 분류 체계로 제시합니다.

OPID는 에이전트가 자신의 사후 과잉 확신(hindsight)을 통해 학습하는 새로운 방법을 제안합니다. 계층적 기술을 완료된 궤적으로부터 직접 증류하여 추론 시 외부 메모리 없이도 높은 효율을 보여줍니다.

Qwen이 11개 언어의 음성에 대해 정밀한 단어 수준 타임스탬프를 예측하는 Qwen3 Forced Aligner를 Hugging Face에 출시했습니다. 이 모델은 LLM 기반의 비자기회적(non-autoregressive) 방식을 사용하여 기존 엔드투엔드 정렬기보다 높은 정확도를 제공합니다.

NVIDIA가 Hugging Face를 통해 실시간 제로샷 스테레오 매칭 모델인 Fast FoundationStereo를 출시했습니다. 이 모델은 기존 파운데이션 모델 대비 정확도를 유지하면서도 속도를 10배 향상시킨 것이 특징입니다.

ByteDance Seed가 T2I, 로컬 및 글로벌 편집을 통합한 단일 플로우 모델인 DanceOPD를 출시했습니다. 이 모델은 기존 증류 방식보다 10배 높은 효율성을 자랑하며, 높은 벤치마크 성능을 유지합니다. 또한 NVIDIA는 Blackwell GPU에 최적화된 753B 파라미터 규모의 GLM-5.2 모델을 출시했습니다.

ViQ는 이산적 시각적 토크나이저와 연속적 인코더 사이의 간극을 메우는 새로운 기술입니다. 모든 해상도에서 이미지를 이산 코드로 처리하여 멀티모달 학습 시간을 20~70%까지 단축할 수 있습니다.

NVIDIA가 Hugging Face에 최적화된 GLM-5.2 모델을 출시했습니다. 이 모델은 753B 파라미터의 MoE 구조를 가지며 1M 컨텍스트를 지원합니다.