Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
텍스트와 이미지를 결합하여 표 형식 데이터를 학습하는 멀티모달 표 형식 학습(Multimodal Tabular Learning)을 위한 벤치마크인 MulTaBench를 소개합니다. 또한 물리 기반의 인간 비디오 생성을 위해 구조화된 3D 모션 보상을 사용하는 PhyMotion 논문을 함께 다룹니다.
TheInclusionAI가 에이전트 워크플로우 최적화를 위해 설계된 1조 파라미터 규모의 오픈 추론 모델인 Ring-2.6-1T를 출시했습니다. 이 모델은 ClawEval에서 63.82점을 기록하며 오픈 모델 중 최상위권 성능을 보여주며, 사용자가 추론 노력 수준을 조절할 수 있는 기능을 제공합니다.
단 하나의 뉴런만으로 거대 언어 모델(LLM)의 안전 정렬(Safety Alignment) 메커니즘을 우회할 수 있다는 연구 결과가 제시되었습니다. 이는 LLM의 보안 취약점과 안전성 확보에 대한 근본적인 질문을 던집니다.
새롭게 출시된 9B 모델은 특히 NousResearch Hermes agent의 도구 호출(tool calling) 및 에이전트 기반 코딩 워크플로우를 위해 특화되어 높은 성능을 보여줍니다. 9B 크기임에도 불구하고 하드웨어 요구 사항이 낮아 저렴한 장비에서도 실행할 수 있다는 장점이 있습니다.
Apple MLR에서 발표한 Normalizing Trajectory Models는 Normalizing Flows를 활용하여 정확한 궤적 가능도(exact trajectory likelihood)를 갖춘 고품질의 적은 단계 생성(few-step generation)을 목표로 합니다. 이 연구는 빠른 생성 모델이 여전히 가능도 기반 접근 방식을 유지할 수 있는지에 대한 질문에 답하는 데 기여합니다.
Direct Corpus Interaction (DCI)라는 새로운 접근 방식이 소개되었습니다. 이 방법은 에이전트 기반 검색(agentic search)을 위한 최적의 검색기(retriever)가 사실상 필요 없다고 주장합니다. 개발자들은 임베딩 모델, 벡터 인덱스, top-k 검색으로 구성된 복잡한 에이전트 기반 검색 파이프라인 전체를 오직 `grep`과 `bash` 명령어만 사용하여 대체할 수 있음을 보여주었습니다.
물리학 및 수학 올림피아드에서 금메달 수준의 성과를 내는 30B-A3B 추론 모델이 출시되었습니다. 이 모델은 IPhO 문제를 직접 해결하며, IMO 및 USAMO 문제의 경우 테스트 시간 자기 검증과 개선 과정을 통해 문제를 해결합니다. 증명 탐색을 위한 단순하고 통합된 스케일링 레시피를 특징으로 합니다.
NVIDIA가 Hugging Face에 학술 논문 리뷰 데이터셋을 공개했습니다. 이 데이터셋에는 실제 리뷰 결정이 포함된 인간 및 AI 작성 논문에 대한 정보가 담겨 있습니다. 구체적으로 APRES, Agents4Science, 그리고 Sakana v2 서브셋을 활용할 수 있습니다.
PhyMotion은 물리적 제약 조건을 고려하여 사실적인 인간 비디오를 생성하는 것을 목표로 하는 방법론입니다. 이 연구는 구조화된 3D 모션 보상(Structured 3D Motion Reward)을 도입하여, 단순히 시각적으로 그럴듯한 영상을 넘어 실제 물리학 법칙에 부합하는 움직임을 가진 고품질의 인간 비디오 생성을 가능하게 합니다.
EgoMemReason은 장기 시계열 1인칭 시점 비디오 이해를 위해 메모리 기반 추론 능력을 평가하는 새로운 벤치마크입니다. 또한, RubricEM은 검증 가능한 보상을 넘어 Rubric 가이드 정책 분해를 활용한 Meta-Reinforcement Learning 방법론을 제안합니다.
HuggingFace의 CEO인 @ClementDelangue는 강력한 오픈 소스 모델 출시와 관련하여 질문을 받았으며, AI를 제한하는 것이 개방성보다 더 큰 위험을 초래한다고 주장합니다. 그는 과거 GPT-2 사례 등을 언급하며 기술의 확산과 자유로운 접근성이 중요함을 강조했습니다.
Hugging Face가 100만 개 이상의 데이터셋을 보유하며 중요한 이정표를 달성했습니다. 현재 사용되는 모든 인기 오픈 모델들은 이러한 방대한 데이터셋들을 기반으로 구축되었습니다. 다음 목표는 코딩 모델의 발전을 위해 더 많은 오픈 코딩 세션 트레이스를 확보하는 것입니다.
본 기사는 로보틱스(Robotics) 분야와 WebAI 기술의 결합에 대해 다루며, Transformers.js와 WebGPU를 활용하여 Gemma 4 같은 AI 모델을 브라우저에서 완전히 오프라인으로 실행하는 방법을 소개합니다. 이를 통해 USB-C 케이블과 웹 환경만으로 Reachy Mini 로봇을 제어할 수 있게 됩니다.
본 연구는 장기간에 걸친 1인칭(egocentric) 시점의 비디오 이해를 위한 새로운 메모리 기반 추론 벤치마크인 EgoMemReason을 소개합니다. 이 벤치마크는 복잡한 상황에서 시간적 흐름과 기억을 활용하여 깊이 있는 추론 능력을 평가하는 데 중점을 두고 있습니다.
이 기사는 멀티샷 비디오 내러티브(Multi-Shot Video Narratives) 생성을 목표로 합니다. 핵심은 '실시간 자기회귀 생성(Real-Time Autoregressive Generation)' 기술을 적용하여 복잡한 영상 스토리텔링을 구현하는 것입니다.
이 기사는 검증 가능한 보상을 넘어서, 'Rubric'이라는 가이드라인 기반의 정책 분해(Policy Decomposition) 방법을 활용하는 Meta-Reinforcement Learning (Meta-RL)에 대해 다룹니다. 이는 복잡한 목표를 구조화된 규칙이나 기준(rubric)으로 나누어 모델이 학습할 수 있도록 돕는 접근 방식입니다.
NVIDIA가 Hugging Face에 AnyFlow라는 새로운 텍스트-투-비디오(text-to-video) 확산 모델을 출시했습니다. 이 모델은 추론 예산과 관계없이 고품질의 비디오를 생성할 수 있는 최초의 any-step 비디오 확산 모델로, 단계 수(예: 4단계 또는 50단계)가 변해도 품질 저하 없이 매끄럽게 확장되는 것이 특징입니다.
이 기술 기사는 Mac 환경에서 Reachy Mini를 구동하기 위한 완전한 로컬 스택을 소개합니다. 이 시스템은 비전, TTS(Text-to-Speech), STT(Speech-to-Text) 기능을 모두 포함하며, mlx-vlm, mlx-audio, 그리고 gemma4와 같은 최신 프레임워크를 활용합니다. 사용자는 이 저장소에서 가족 환경에서도 실행할 수 있는 다양한 예제와 프롬프트를 얻을 수 있습니다.
physics-intern은 이론 물리학 분야의 복잡하고 어려운 연구 질문을 해결하기 위해 설계된 에이전트 프레임워크입니다. 이 프레임워크는 문제를 여러 개의 작은 작업으로 분해하고, 각 작업을 계산, 주장 검토, 전략 도출 등 전문화된 하위 에이전트 팀에 할당하여 작동합니다. 이를 통해 LLM 단독으로는 해결하기 어려웠던 연구 수준의 물리학 문제에서 최신 성능(SOTA)을 달성했습니다.
Reachy Mini가 새로운 기능을 탑재하며, 개발자들은 이제 Reachy Mini와 상호작용할 수 있는 완전한 오픈 소스 백엔드를 사용할 수 있게 되었습니다. 기존에는 실시간 음성 에이전트 구현에 높은 비용(하루 $20+)이 발생했지만, 이 새로운 접근 방식은 오디오 모델을 로컬에서 실행하고 LLM으로 OpenAI나 Claude 구독만 사용함으로써 추가 비용 없이도 가능하게 했습니다. 이 시스템은 Mac mini와 같은 저렴한 하드웨어에서도 효율적으로 작동하며, 곧 자세한 튜토리얼이 제공될 예정입니다.