Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

6개 도메인을 대상으로 LLM의 데이터 구축 및 품질 평가 능력을 측정하는 최초의 통합 벤치마크인 DataPrep-Bench를 소개합니다. 훈련 데이터 준비자로서의 LLM 성능을 체계적으로 평가합니다.

207개의 GitHub 프로젝트와 102만 개의 풀 리퀘스트를 분석한 연구 결과, AI 에이전트가 코드 리뷰 속도는 높여주지만 리뷰 품질을 반드시 향상시키지는 않는다는 사실이 밝혀졌습니다.

체스 연구를 통해 사전 학습 손실이 사후 강화학습 성능을 예측할 수 있음을 밝힙니다. 또한 강화학습이 어려운 퍼즐에서 새로운 정답을 찾아내는 능력이 있음을 보여줍니다.

Alibaba가 LLM을 추천 시스템의 핵심 엔진으로 활용하는 RecGPT-V3를 공개했습니다. 이 모델은 지속적 메모리와 하이브리드 모달리티를 통해 Taobao 서비스 비용을 52.4% 절감하고 GMV를 3.97% 향상시켰습니다.

비동기 강화학습(async RL) 시 발생하는 데이터 지연성(Staleness) 문제를 해결하기 위한 새로운 방법론을 제안합니다. 지연성이 높은 토큰에 대해 PPO의 클립 반경을 동적으로 조절하여 학습 붕괴를 방지합니다.

70개 이상의 언어와 200만 시간의 데이터를 학습한 오픈 소스 음성 파운데이션 모델 GigaAM Multilingual을 소개합니다. Conformer 인코더 구조를 사용하여 중앙아시아 언어에서 Whisper-large-v3보다 뛰어난 성능을 입증했습니다.

GigaChat Audio는 GigaAM 인코더와 10B MoE 디코더를 결합한 오픈 소스 오디오 LLM입니다. 2시간 분량의 오디오에서 48.3 mIoU의 성능으로 시간적 접지(Temporal grounding)를 수행할 수 있습니다.

ByteDance 연구진이 마스크 없이 이미지 편집만으로 비디오 편집 데이터를 실시간 생성하는 FlowMimic 프레임워크를 제안했습니다. 단일 1.3B 모델을 통해 추가 모듈 없이 다양한 비디오 편집 작업을 수행할 수 있습니다.

Ant Group이 스마트폰으로 수집한 2,000시간 분량의 1인칭 시점 조작 데이터를 공개했습니다. 이 데이터셋은 손 포즈, 카메라 궤적, 원자적 동작 및 모델 학습을 위한 전체 툴체인을 포함합니다.

Alibaba가 Hugging Face를 통해 RynnBrain 1.1 모델 제품군을 출시했습니다. 이 모델은 로봇 조작을 위한 인지, 공간 추론, 계획 및 접촉점 예측 등을 지원하는 체화된 파운데이션 모델(Embodied Foundation Models)입니다.

이미지 생성 모델의 공간 인지 능력을 평가하기 위한 새로운 벤치마크를 소개합니다. 이 방식은 텍스트 대신 픽셀로 답변하게 하여 모델의 공간 이해도를 측정하며, GPT Image 2가 기존 모델보다 뛰어난 성능을 보임을 입증합니다.

Tencent에서 발표한 ReferTrack은 Embodied Visual Tracking을 위한 '참조 후 추적(referring-then-tracking)' 패러다임을 제안합니다. 바운딩 박스로 대상을 먼저 선택한 뒤, 이미지 결정에 기반하여 트래킹 웨이포인트를 디코딩하는 방식입니다.

BAAI가 재귀적 자기 개선을 통해 심층 연구를 수행하는 에이전트인 AREX를 공개했습니다. 정답을 연구하고 제약 조건에 따라 검증하며, 효과적인 부분을 보존하고 미흡한 점을 개선하는 방식을 채택했습니다.

중국의 K-12 교과서를 기반으로 구축된 커리큘럼 정렬 지식 그래프인 K12-KGraph를 소개합니다. 이 데이터셋은 방대한 노드와 엣지, 질문 벤치마크를 포함하며, Gemini-3-Flash와 같은 모델도 낮은 성능을 보일 만큼 높은 난이도를 자랑합니다.

Anchor-Align은 사전 학습된 VLM의 표현을 보존하면서 언어를 행동과 정렬하는 VLA 미세 조정 방법론입니다. 이를 통해 실제 로봇의 일반화 성능을 기존 28%에서 54%로 크게 향상시켰습니다.

사실적 말뭉치로부터 LoRA 어댑터를 생성하는 하이퍼네트워크(Hypernetworks)가 기존의 LoRA 및 전체 미세 조정보다 우수한 일반화 성능을 보인다는 연구 결과입니다. 모델의 규모가 커질수록 이러한 성능 격차는 더욱 확대되는 스케일링 법칙을 제시합니다.

모델이 반복적인 관찰과 추론을 통해 새로운 시각적 증거를 탐색할 수 있는지 평가하는 새로운 벤치마크인 ActiveVision을 소개합니다. 현재 프론티어 모델들은 인간의 성능에 비해 매우 낮은 점수를 기록하며 시각적 탐색 능력의 한계를 보여줍니다.

Tencent Yuanbao가 문서 세트를 9가지 차원에서 종합적으로 평가하는 루브릭 기반 프레임워크인 SetwiseEvalKit과 최적의 세트 선택을 위한 Rubric4Setwise를 제안했습니다.

자기회귀 비디오 모델의 컨텍스트-경사 경로 누락 문제를 해결하는 'Self Gradient Forcing' 학습 전략을 소개합니다. 5초의 짧은 윈도우 학습만으로도 일관성을 유지하며 분 단위의 긴 비디오를 생성할 수 있습니다.

Ascend 환경에서 진행된 DeepSeek-V4 사후 학습(post-training) 성과를 다룹니다. SLAI T-Rex를 통해 속도를 2.93배 향상시켰으며, 운영 연구 분야에서 GPT-5.4-Mini를 능가하는 성능을 기록했습니다.