Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Apple MLR에서 발표한 Normalizing Trajectory Models는 Normalizing Flows를 활용하여 정확한 궤적 가능도(exact trajectory likelihood)를 갖춘 고품질의 적은 단계 생성(few-step generation)을 목표로 합니다. 이 연구는 빠른 생성 모델이 여전히 가능도 기반 접근 방식을 유지할 수 있는지에 대한 질문에 답하는 데 기여합니다.
Direct Corpus Interaction (DCI)라는 새로운 접근 방식이 소개되었습니다. 이 방법은 에이전트 기반 검색(agentic search)을 위한 최적의 검색기(retriever)가 사실상 필요 없다고 주장합니다. 개발자들은 임베딩 모델, 벡터 인덱스, top-k 검색으로 구성된 복잡한 에이전트 기반 검색 파이프라인 전체를 오직 `grep`과 `bash` 명령어만 사용하여 대체할 수 있음을 보여주었습니다.
물리학 및 수학 올림피아드에서 금메달 수준의 성과를 내는 30B-A3B 추론 모델이 출시되었습니다. 이 모델은 IPhO 문제를 직접 해결하며, IMO 및 USAMO 문제의 경우 테스트 시간 자기 검증과 개선 과정을 통해 문제를 해결합니다. 증명 탐색을 위한 단순하고 통합된 스케일링 레시피를 특징으로 합니다.
NVIDIA가 Hugging Face에 학술 논문 리뷰 데이터셋을 공개했습니다. 이 데이터셋에는 실제 리뷰 결정이 포함된 인간 및 AI 작성 논문에 대한 정보가 담겨 있습니다. 구체적으로 APRES, Agents4Science, 그리고 Sakana v2 서브셋을 활용할 수 있습니다.
PhyMotion은 물리적 제약 조건을 고려하여 사실적인 인간 비디오를 생성하는 것을 목표로 하는 방법론입니다. 이 연구는 구조화된 3D 모션 보상(Structured 3D Motion Reward)을 도입하여, 단순히 시각적으로 그럴듯한 영상을 넘어 실제 물리학 법칙에 부합하는 움직임을 가진 고품질의 인간 비디오 생성을 가능하게 합니다.
EgoMemReason은 장기 시계열 1인칭 시점 비디오 이해를 위해 메모리 기반 추론 능력을 평가하는 새로운 벤치마크입니다. 또한, RubricEM은 검증 가능한 보상을 넘어 Rubric 가이드 정책 분해를 활용한 Meta-Reinforcement Learning 방법론을 제안합니다.
본 연구는 장기간에 걸친 1인칭(egocentric) 시점의 비디오 이해를 위한 새로운 메모리 기반 추론 벤치마크인 EgoMemReason을 소개합니다. 이 벤치마크는 복잡한 상황에서 시간적 흐름과 기억을 활용하여 깊이 있는 추론 능력을 평가하는 데 중점을 두고 있습니다.
이 기사는 검증 가능한 보상을 넘어서, 'Rubric'이라는 가이드라인 기반의 정책 분해(Policy Decomposition) 방법을 활용하는 Meta-Reinforcement Learning (Meta-RL)에 대해 다룹니다. 이는 복잡한 목표를 구조화된 규칙이나 기준(rubric)으로 나누어 모델이 학습할 수 있도록 돕는 접근 방식입니다.
physics-intern은 이론 물리학 분야의 복잡하고 어려운 연구 질문을 해결하기 위해 설계된 에이전트 프레임워크입니다. 이 프레임워크는 문제를 여러 개의 작은 작업으로 분해하고, 각 작업을 계산, 주장 검토, 전략 도출 등 전문화된 하위 에이전트 팀에 할당하여 작동합니다. 이를 통해 LLM 단독으로는 해결하기 어려웠던 연구 수준의 물리학 문제에서 최신 성능(SOTA)을 달성했습니다.
과거에는 복잡한 설정 때문에 Hugging Face 모델을 실제로 실행하는 데 많은 시간(하루 또는 며칠)이 걸렸지만, 이제는 AI Native Cloud 환경에서 단일 세션만으로 쉽게 배포할 수 있게 되었습니다. 이 혁신적인 변화는 사용자들이 아이디어를 실제 작동하는 애플리케이션으로 빠르게 전환할 수 있도록 지원합니다.
이 기술 기사는 강화 학습(Reinforcement Learning)을 활용하여 'Skill-Augmented Agent'의 통합적이고 진화적인 발전을 다룹니다. 에이전트가 다양한 스킬들을 효과적으로 습득하고 조합하며, 이를 통해 복잡한 작업을 수행할 수 있도록 하는 방법을 제시합니다. 궁극적으로는 에이전트의 능력을 확장하고 지능을 향상시키는 데 초점을 맞추고 있습니다.
SkillOS는 자율적으로 진화하는 에이전트(Self-Evolving Agents)를 위한 기술 학습 커레이션 프레임워크입니다. 이 시스템은 복잡한 작업을 수행하기 위해 필요한 다양한 지식과 스킬을 체계적으로 식별하고, 이를 효과적인 학습 경로로 구성하여 제공합니다. SkillOS는 단순히 정보를 모으는 것을 넘어, 에이전트가 스스로 부족한 부분을 파악하고 능동적으로 학습할 수 있도록 지원하는 것이 핵심입니다.
MiA-Signature는 긴 컨텍스트 이해를 위해 글로벌 활성화(Global Activation)를 근사화하는 새로운 방법을 제안합니다. 이 방법은 모델이 입력 전체의 전역적인 패턴과 관계를 효과적으로 포착하도록 돕습니다. 이를 통해 기존 모델들이 어려움을 겪었던 장거리 의존성 및 복잡한 컨텍스트 이해 능력을 향상시킬 수 있습니다.
이 기술 기사는 'TIDE'라는 개념을 소개하며, 모든 계층(Layer)이 컨텍스트 아래의 토큰(Token)에 대한 지식을 갖는다는 점을 강조합니다. 이는 언어 모델이나 복잡한 시스템에서 각 구성 요소가 전체 맥락과 근본적인 단위 정보를 동시에 이해해야 함을 시사하는 아키텍처적 접근 방식입니다.
글쓴이는 GOSIM 기간 동안 Hugging Face 파리 사무실을 방문한 경험을 공유했습니다. 이 글은 오픈소스 AI 리더인 Hugging Face의 분위기를 묘사하며, 그들이 시내 중심가에 조용히 자리 잡고 최고의 오픈 소스 작업을 지속적으로 출시하는 모습을 강조합니다.
Tencent 연구진은 물리 기반의 3D 자산 생성을 위한 혁신적인 두 단계 프레임워크를 제안했습니다. 이 시스템은 VLM(Vision-Language Model) 아키텍처가 계층적 청사진을 계획하고, 이후 KineVoxel Injection을 활용한 확산 모델이 시뮬레이션 준비가 된 3D 자산을 생성하는 방식으로 작동합니다. 본 프레임워크는 PhysDB 기반의 대규모 데이터셋(150K)으로 학습되었습니다.
최신 모델인 Qwopus3.6-35B-A3B-v1이 출시되었으며, 성능 면에서 뛰어난 결과를 보여줍니다. 사용자는 댓글에 제공된 HF space 벤치마크 쇼케이스와 글을 통해 직접 그 우수성을 확인할 수 있습니다. 이 모델은 GGUF 형식으로 다운로드 가능하며, 개발팀은 훈련 과정에서 발견한 문제점을 수정했다고 밝히고 있습니다.
이 기술 기사는 스트리밍 비디오 생성의 신뢰성(reliability)과 복잡도(perplexity)를 동시에 고려하는 보상 증류(Reward Distillation) 방법을 제안합니다. 이를 통해 생성된 비디오가 시간적 일관성을 유지하고 자연스러우면서도 예측 가능한 콘텐츠를 갖도록 개선할 수 있습니다. 특히, 스트리밍 환경에 최적화되어 실시간으로 고품질의 비디오 콘텐츠를 생성하는 데 기여합니다.
Endless Terminals 프로젝트는 인간의 주석 없이 강화학습(RL) 훈련에 필요한 터미널 작업을 절차적으로 생성하는 자동화 파이프라인을 구축했습니다. 이 프로젝트는 지난달에만 Hugging Face에서 73,000회 이상의 다운로드 기록을 세우며 큰 주목을 받고 있습니다. 이는 단순한 PPO와 스케일링된 환경만으로도 Terminal Bench 2.0과 같은 후속 작업에서 일관되고 의미 있는 개선점을 제공함을 보여줍니다.
이 기술 기사는 '공간적 변이 색상 primitives(Spatially Varying Color Primitives)'를 활용하여 Gaussian Splatting의 성능을 향상시키는 방법을 제안합니다. SVGS는 3D 장면 재구성에 사용되는 핵심 요소인 가우시안 스플래팅에 공간적으로 변화하는 색상 정보를 통합함으로써, 기존 방식보다 더 사실적이고 디테일한 시각적 결과를 얻을 수 있게 합니다. 이를 통해 고품질의 3D 콘텐츠 생성 및 시뮬레이션 분야에서 중요한 발전을 이룰 것으로 기대됩니다.