Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

지시어 기반 오디오 편집 성능을 측정하기 위한 최초의 포괄적인 벤치마크인 MMAE를 소개합니다. 7가지 모달리티와 다양한 복잡도 레벨을 포함하며, 현재 주요 모델들이 복잡한 작업에서 낮은 정확도를 보임을 입증했습니다.

EmbedFilter는 선형 투영을 통해 고주파 토큰 부공간을 필터링하여 LLM 임베딩을 정제하는 기술입니다. 이를 통해 추가 비용 없이 차원을 축소하면서도 Zero-shot 검색 성능을 향상시킵니다.

SoCRATES는 8가지 갈등 영역에서 LLM의 선제적 중재 능력을 평가하는 도구입니다. 연구 결과, 최상위 모델들도 전문가와 비교했을 때 합의 격차의 약 1/3만을 해결하는 한계를 보였습니다.

ByteDance Seed가 멀티모달 에이전트의 기억력을 향상시키는 강화학습(RL) 프레임워크인 TaskMem을 출시했습니다. Qwen3-VL-30B를 기반으로 하며, 작업에 따라 메모리 초점을 동적으로 전환하여 VQA 정확도를 높입니다.
SANA-Streaming은 단일 RTX 5090에서 1280×704 해상도로 24 FPS의 실시간 비디오 편집 성능을 구현합니다. 하이브리드 확산 트랜스포머와 사이클-역방향 정규화 기술을 통해 긴 비디오에서도 뛰어난 시간적 일관성을 유지합니다.

dMoE는 확산 LLM(diffusion LLMs)을 위한 블록 수준 라우팅 기술을 제안합니다. 성능 저하를 최소화하면서 활성화되는 전문가 수를 줄여 메모리 효율성과 추론 속도를 대폭 개선했습니다.

Hugging Face가 선정한 6월 첫째 주 주요 AI 연구 논문 목록입니다. PEFT 스케일링, 멀티 에이전트 도표 생성, 투기적 디코딩, 물리적 AI를 위한 월드 모델 등 다양한 최신 연구 동향을 다룹니다.

ByteDance가 파노라마 비디오와 텍스트를 기반으로 고충실도 공간 오디오를 생성하는 스트리밍 프레임워크 SwanSphere를 출시했습니다. 인과적 자기회귀 확산 트랜스포머를 활용하여 실시간으로 몰입형 오디오를 생성하는 것이 특징입니다.

칭화대학교 연구진이 LLM-as-a-Judge 환경에서 발생하는 보상 해킹(reward hacking)을 연구하기 위한 테스트베드인 CHERRL을 발표했습니다. 편향 주입을 통해 해킹을 유발하고 탐지하는 기술을 제안합니다.

20억 개의 모션 프레임을 학습한 GPT 스타일의 트랜스포머 모델로, 제로샷 휴머노이드 제어를 가능하게 합니다. 별도의 미세 조정 없이도 G1 로봇이 축구, 춤 등 역동적인 동작을 수행할 수 있는 일반화 능력을 보여줍니다.

Function2Scene은 디자인 브리프를 분석하여 3D 실내 레이아웃을 생성하는 모델입니다. 인체공학적 제약 조건을 활용한 반복적 정제 과정을 통해 기존 모델 대비 높은 성능을 달성했습니다. 또한 JetBrains의 새로운 MoE 모델인 Mellum2의 오픈 소스 공개 소식도 포함되어 있습니다.
이미지 복원 작업을 위한 GGT-100K 데이터셋과 멀티모달 모델 벤치마킹 연구를 소개합니다. 또한 JetBrains가 공개한 12B MoE 모델인 Mellum2의 효율적인 아키텍처와 성능을 다룹니다.

JetBrains가 12B MoE 모델인 Mellum2를 오픈 소스로 공개했습니다. 2.5B의 활성 파라미터만 사용하여 코드 생성, 추론, 에이전트 워크플로에 최적화된 성능을 제공합니다.
탐색 에이전트의 성능 향상을 위한 오래된 관측값 마스킹 효과를 연구했습니다. 모델 규모에 따라 컨텍스트 관리의 이득이 역U자형 곡선을 그리며, 고급 모델에서는 오히려 성능이 저하될 수 있음을 발견했습니다.

Domino는 자기회귀 초안 작성 과정과 인과적 모델링을 분리한 새로운 투기적 디코딩 프레임워크입니다. 병렬 백본과 경량 헤드를 결합하여 Qwen3 모델에서 최대 5.8배의 처리량 향상을 달성했습니다.

Google이 Hugging Face에 QAT(양자화 인식 학습)로 최적화된 Gemma 4 31B 모델을 출시했습니다. 이 모델은 bfloat16 수준의 품질을 유지하면서 vLLM에서의 메모리 사용량을 획기적으로 줄였습니다. 또한 Code2LoRA 기술을 통해 저장소를 단 한 번의 순전파로 LoRA 어댑터로 변환할 수 있습니다.
NVIDIA가 Hugging Face를 통해 Anchor Lab 데이터셋을 출시했습니다. 이 데이터셋은 시뮬레이션과 실제 환경 간의 제로샷 전이를 지원하기 위해 물리적 데이터와 시뮬레이션 보정용 로봇 공학 측정 데이터를 제공합니다.

Code2LoRA는 단 한 번의 순전파를 통해 전체 코드 저장소를 LoRA 어댑터로 변환하는 기술입니다. 하이퍼네트워크를 사용하여 코드베이스 지식을 가중치로 압축함으로써, 별도의 미세 조정이나 거대한 컨텍스트 윈도우 없이도 효율적인 코드 이해를 가능하게 합니다.

LLM 에이전트의 적응적 재계획 능력을 평가하는 AdaPlanBench와 시각적 추론을 위한 VideoKR 데이터셋을 소개합니다. AdaPlanBench는 가사 작업 중 발생하는 제약 조건을 통해 에이전트의 대응력을 테스트하며, VideoKR은 전문가 도메인 비디오를 활용한 고도화된 비디오 이해를 목표로 합니다.

ArcANE은 에이전트가 정적인 회상을 넘어 심리적 서사를 따르며 캐릭터를 유지하는지 테스트하는 새로운 벤치마크입니다. 17권의 소설과 80명의 캐릭터를 활용하여 원문 텍스트를 벗어난 시나리오에서의 캐릭터 일관성을 평가합니다.