Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
대규모 언어 모델(LLM)이 작업을 수행할 때, 사용자의 의도에 100% 충실하기보다는 가장 빠르고 효율적인 '지름길'을 택하는 경향을 보여줍니다. 이는 Codex의 Image 도구 활용 사례를 통해 관찰되었으며, 결과적으로 창의적일 수 있으나 산업적/상업적 생산에서는 여전히 환각(hallucination) 문제 해결이 필요합니다.
Google이 로봇의 고수준 추론을 담당하는 Gemini Robotics ER 2 모델을 출시했습니다. 이 모델은 환경 관찰, 추론, 동작 조율을 수행하며 로봇의 '두뇌' 역할을 하여 복잡한 작업을 수행하고 오류를 스스로 수정할 수 있게 합니다.
Thinking Machines가 모델 크기를 1/4로 압축하면서도 성능을 유지한 Inkling-Small을 공개했습니다. 이 모델은 276B 파라미터 중 12B만 활성화하여 추론 및 에이전트 작업에서 대형 모델과 대등한 성능을 보여줍니다.

Unsloth 팀이 2.8T 규모의 Kimi K3 모델을 1-bit 양자화하여 594GB로 압축하는 데 성공했습니다. 이를 통해 Mac Studio 128GB 환경에서도 로컬 추론이 가능해졌으며, 높은 정확도를 유지하며 모델 크기를 획기적으로 줄였습니다.
Microsoft가 4B 규모의 코덱 네이티브 스트리밍 시각 모델인 Mage-VL을 출시했습니다. 이 모델은 실시간 영상을 분석하여 발생하는 사건을 자연어로 설명하고 특정 시점을 지정할 수 있는 효율적인 VLM입니다.
Moonshot AI의 최신 플래그십 모델인 Kimi K3가 오픈 소스로 공개될 예정입니다. 2.8조 개의 파라미터를 보유한 이 모델은 장시간 프로그래밍과 에이전트 작업에 특화되어 있습니다.
Black Forest Labs가 이미지, 비디오, 오디오, 로봇 동작 예측을 하나의 통합 아키텍처로 처리하는 FLUX 3를 공개했습니다. 멀티모달 백본을 통해 콘텐츠 생성과 물리적 세계의 지능을 동일한 시각 기초 모델 위에서 구현한 것이 특징입니다.
Kimi의 MoonViT 시각 인코더를 GLM 5.2에 결합하여 멀티모달 기능을 구현한 사례를 소개합니다. 공식 공동 학습 없이도 모듈형 결합을 통해 실질적인 시각 인식 성능을 확보할 수 있음을 보여줍니다.

야오진강 교수가 8대 AI 플랫폼의 검색 인용 데이터를 포함한 대규모 오픈소스 데이터셋을 공개했습니다. 이 데이터셋은 주요 플랫폼의 인용 패턴을 분석할 수 있는 정량적 지표를 제공하여 AI 최적화 연구를 돕습니다.

Moonshot AI가 자사의 최첨단 LLM인 K3 모델 가중치를 오픈소스로 공개할 예정임을 발표했습니다. 이는 중국어 대규모 언어 모델 분야의 선두 주자가 최고 성능 모델을 개방하는 이례적인 사례입니다. 이러한 결정은 기술 발전이 소수에게 독점되어서는 안 되며, 진정한 리더십은 공유를 통해 증명될 수 있다는 강력한 메시지를 전달합니다.
OpenMOSS가 실시간 비디오 스트림 상호작용에 특화된 11B 멀티모달 모델 MOSS-VL-Realtime을 오픈소스로 공개했습니다. 이 모델은 전통적인 오프라인 방식과 달리, 비디오 입력 과정에서 인지(Perception)와 생성(Generation)을 동기화하여 실시간 대화를 구현합니다. Cross-Attention 아키텍처와 256K 컨텍스트 창 등 기술적 진보를 보여줍니다.
GPT가 arXiv 논문을 상호작용 가능한 Marimo 노트북으로 자동 변환하는 기능을 제공합니다. 이 기능은 논문의 핵심 실험을 재현하고, 결과를 시각화하며 실시간 파라미터 수정이 가능하게 합니다. 이를 통해 연구 과정에서 지식을 단순히 이해하는 것을 넘어 직접 조작하고 검증할 수 있게 됩니다.
Anthropic은 Claude 모델 내부의 신경 활성화 공간인 'J-space'를 발견했습니다. 이 공간은 명시적인 텍스트 출력 없이도 모델이 다단계 추론과 개념 인식을 수행하는 핵심 메커니즘으로 작동합니다.

Google이 논문 심사 보조를 위한 AI 프레임워크인 Paper Assistant Tool(PAT)을 출시했습니다. 이 도구는 추론 스케일링을 통해 논문의 이론적 추론과 실험 결과를 검증하며, 수학적 오류 탐지 성능을 크게 향상시켰습니다.

기존 AI가 다음 토큰이나 프레임을 예측하는 통계적 모방에 의존하는 것과 달리, Orca는 물리 세계의 숨겨진 '상태(State)'를 예측하는 새로운 접근 방식을 제시합니다. 비디오와 언어적 이벤트를 통해 물리 법칙을 학습함으로써, 별도의 동작 라벨 없이도 행동 능력을 습득할 수 있음을 증명했습니다.
GenRecon은 생성형 3D 사전 지식과 다중 뷰 재구성을 결합하여 스마트폰으로 고품질 3D 모델링을 가능하게 하는 새로운 방법론을 제안합니다. 장면을 청크 단위로 나누어 생성 모델로 재구성하는 방식을 통해 기존 SOTA 대비 뛰어난 성능을 보여줍니다.

ByteDance가 음성, 음악, 효과음을 동시에 생성할 수 있는 멀티모달 오디오 모델 Seed Audio 1.0을 출시했습니다. 참조 오디오 및 이미지 가이드를 지원하며, 다양한 파라미터를 통해 정밀한 제어가 가능한 것이 특징입니다.
Google Research가 공개한 TimesFM은 방대한 데이터를 사전 학습하여 제로샷 시계열 예측이 가능한 디코더 전용 파운데이션 모델입니다. 최신 버전은 파라미터 수를 줄이면서도 컨텍스트 길이를 확장하여 효율성과 성능을 동시에 잡았습니다.

OpenAI가 GPT-5.6 시리즈를 공식 출시했으나, 현재는 미국 정부의 요청에 따라 제한된 프리뷰 형태로만 제공됩니다. 성능 중심의 Sol, 가성비의 Terra, 고처리량의 Luna로 구성되어 있습니다.
에이전트 기반 코딩에 특화된 새로운 오픈 소스 모델 제품군 Ornith-1.0이 출시되었습니다. RL을 통해 작업 프레임워크 구축 능력을 최적화하여 에이전트 코딩 벤치마크에서 최상위 성능을 보여줍니다.