Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

VideoKR은 지식 및 추론 집약적인 비디오 이해를 위해 설계된 최초의 데이터셋입니다. 인간 참여형 생성 방식을 통해 145K개의 전문가 도메인 비디오에서 315K개의 예시를 구축했습니다.

실시간 스트리밍 오디오 처리를 위해 '인지-결정-응답' 루프를 통합한 새로운 모델을 소개합니다. 전사, 채팅, 선제적 개입을 하나의 상시 가동 모델로 구현하여 스스로 발화 시점을 결정할 수 있습니다.

NVIDIA가 손상된 3D 재구성을 고품질 장면으로 변환하는 ArtiFixer 모델을 Hugging Face에 출시했습니다. 또한 Alibaba는 고품질 텍img-to-image 생성 및 편집이 가능한 Qwen-Image-Flash를 공개했습니다.
NVIDIA가 Hugging Face를 통해 에이전트 안전성(agentic safety)을 위한 새로운 데이터셋을 공개했습니다. 이 데이터셋은 9개 기업 도메인에서 생성된 1,272개의 합성 레드팀 기록을 포함합니다.

NVIDIA가 Hugging Face를 통해 Nemotron 3 Ultra 모델을 출시했습니다. 이 모델은 하이브리드 Mamba-2 MoE Transformer 구조를 채택하여 높은 효율성을 제공합니다.

Alibaba가 새로운 모델인 Qwen-Image-Flash를 출시했습니다. 이 모델은 증류(distillation) 기술을 통해 고품질의 텍스트-이미지 생성 및 지시어 기반 편집 기능을 제공합니다.

DRIFT는 심층 연구 에이전트의 오류를 스팬 수준에서 국지화하여 근거 없는 주장이 확정적 주장으로 변하는 지점을 찾아냅니다. 또한 Huawei는 FP16의 정확도를 유지하면서 컨텍스트 길이를 3~5배 확장하는 KV-캐시 압축 기술인 KVarN을 출시했습니다.
NVIDIA가 Physical AI를 위한 옴니모달 월드 모델인 Cosmos 3를 출시했습니다. 이 모델은 텍스트, 이미지, 비디오, 오디오 및 로봇 동작을 통합하여 추론, 생성 및 시뮬레이션이 가능합니다.
Huawei가 LLM의 컨텍스트 길이를 3~5배 확장하는 KV-cache 압축 기술인 KVarN을 공개했습니다. FP16 수준의 정확도를 유지하면서도 높은 처리량을 제공하며, 별도의 보정 없이 vLLM에서 즉시 사용 가능합니다.

OCC-RAG는 0.6B 및 1.7B 규모의 소형 모델을 활용하여 구조화된 추론 흔적과 문자 그대로의 인용을 통해 충실한 질의응답을 수행합니다. 이를 통해 소형 모델임에도 불구하고 32B 규모의 LLM과 대등하거나 이를 능가하는 성능을 보여줍니다.

BrainCause는 생성 모델과 반사실적 자극을 결합하여 뇌의 시각적 표현을 연구합니다. 단순한 활성화 지도를 넘어 신경 인과관계를 검증하는 새로운 접근 방식을 제시합니다.
Microsoft가 Office 파일의 구조적 인지 및 비즈니스 추론 능력을 평가하는 새로운 데이터셋을 공개했습니다. 또한 Google은 온디바이스 환경에서 실시간 음악 생성이 가능한 오픈 웨이트 모델인 Magenta RealTime 2를 발표했습니다.

Google이 Hugging Face를 통해 Magenta RealTime 2를 출시했습니다. 이 모델은 온디바이스 환경에서 실시간 연속 음악 생성을 지원하는 유일한 오픈 웨이트 모델입니다.

다중 도메인 강화학습(RL) 시 발생하는 도메인 간 간섭 문제를 국소 섭동 이론으로 분석합니다. 짧은 리프레시 과정을 통해 기존 기술의 손실을 선택적으로 복구하고 성능을 최적화할 수 있음을 보여줍니다.

TrOPD는 온-폴리시 증류 과정의 불안정성을 해결하기 위해 신뢰 영역 내에서 교사 감독을 적용하는 새로운 방법론입니다. 이상치 추정과 오프-폴리시 가이드를 통해 탐색을 유지하며 수학적 추론 및 코드 생성 성능을 높였습니다.

Draft-OPD는 기존 오프라인 학습 방식의 한계를 극복하기 위해 온폴리시(on-policy) 학습 방식을 도입했습니다. 거부된 토큰을 재생하여 초안 모델이 스스로의 오류로부터 학습하게 함으로써 추측 디코딩의 효율을 극대화합니다.

Harness-1은 RL(강화학습)로 학습된 20B 규모의 검색 에이전트입니다. 상태 관리를 외재화하여 정책이 의미론적 결정에만 집중하게 함으로써, 복잡한 검색 작업에서 GPT-4o와 대등하거나 더 뛰어난 성능을 보여줍니다.

PEFT(Parameter-Efficient Fine-Tuning)를 활용하여 공유된 파운데이션 모델 위에 개인화된 어댑터를 지속적인 로컬 상태로 구축하는 연구를 소개합니다. 모델의 규모와 개인화 성능을 확장하기 위한 세 가지 스케일링 축(up, down, out)을 탐구합니다.

NVIDIA가 CVPR 2026 Highlight 모델인 4D-RGPT를 Hugging Face에 출시했습니다. 이 모델은 추가 추론 비용 없이 학습 단계에서 깊이와 움직임을 학습하여 영역 수준의 4D 비디오 이해를 지원합니다. 또한 ByteDance는 음향적 일관성을 유지하며 다수 화자의 대화를 합성하는 SwanVoice를 공개했습니다.

AI 에이전트의 한국어 웹사이트 탐색 능력을 평가하기 위한 새로운 벤치마크인 K-BrowseComp를 소개합니다. GPT-5.5와 같은 최신 모델들도 복잡한 질문과 합성 진단 작업에서 낮은 성능을 보이며 한계를 드러냈습니다.