Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Gemma 4 12B와 Google AI Edge의 통합을 통해 노트북에서 100% 온디바이스 에이전틱 워크플로우를 실행할 수 있게 되었습니다. LiteRT-LM을 활용하여 네트워크 연결 없이 로컬에서 모델을 서빙하며, 개인정보 보호와 저지연성을 동시에 확보합니다.

Fei-Fei Li는 AI의 다음 프런티어로 공간 지능을 제시하며, 세계 모델을 렌더러, 시뮬레이터, 플래너의 세 가지 핵심 기능으로 분류합니다. 특히 물리적 정확성을 담보하는 시뮬레이터가 렌더링과 계획을 잇는 구조적 중추임을 강조합니다.
OpenAI가 생명과학 연구에 특화된 기업용 모델인 GPT-Rosalind를 업그레이드했습니다. 이 모델은 GPT-5.5의 에이전트 코딩 및 도구 호출 능력을 기반으로 신약 개발과 분자 분석 등 전문적인 연구 워크플로우를 직접 수행합니다.

MOSS-Audio는 음성, 음악, 환경음을 하나의 모델로 통합한 오픈소스 오디오-언어 모델입니다. 기존의 분절된 폐쇄형 솔루션과 달리 아키텍처 차원에서 세 요소를 통합하여 뛰어난 성능을 보여줍니다.

Microsoft AI가 처음부터 새롭게 학습된 7개의 MAI 모델 제품군을 발표했습니다. 추론, 코딩, 이미지, 전사, 음성 등 각 작업에 특화된 모델들로 구성되었으며, 데이터 혈통의 순수성과 모델 간 협업을 강조합니다.
Google DeepMind가 Gemini 기반의 다중 에이전트 시스템인 'Co-Scientist'를 발표했습니다. 이 시스템은 가설 생성부터 검증까지 과학적 연구 사이클 전체를 수행하며 연구자의 혁신적인 파트너 역할을 합니다.
OpenAI가 Python 코드 내에서 직접 Codex를 제어할 수 있는 SDK를 출시했습니다. 스레드 관리, 상태 유지, 샌드박스 제어 기능을 통해 Codex를 단순한 IDE를 넘어 프로그래밍 가능한 인프라로 확장했습니다.

ByteDance Seed의 Gu Quanquan 교수가 퇴사를 발표하며 지난 3년간의 연구 성과를 요약했습니다. 그는 AI 기반 신약 개발 모델인 SeedFold와 SeedProteo를 구축하고, LLM의 사전 훈련 및 스케일링 기술을 혁신하는 데 기여했습니다.
ComfyUI가 이미지, 3D, 오디오, 비디오를 아우르는 11개의 최신 모델을 통합하며 워크플로우 생산성을 극대화하고 있습니다. Krea 2, VOID, Tripo 3.1 등 다양한 모델을 노드 방식으로 드래그 앤 드롭하여 복잡한 멀티모달 작업을 손쉽게 수행할 수 있습니다.
Gemini Omni를 활용하여 외모와 목소리를 복제한 디지털 휴먼을 만드는 방법과 튜토리얼을 소개합니다. 사진과 음성 녹음만으로 간단히 아바타를 생성할 수 있으며, SynthID 워터마크를 통해 딥페이크 리스크를 방지합니다.

KwaiKeye가 30B 파라미터 규모의 오픈 소스 멀티모달 모델인 Keye VL 2.0-30B-A3B를 출시했습니다. DeepSeek Sparse Attention을 통해 256K 컨텍스트를 지원하며, 비디오 프레임이 늘어날수록 이해도가 향상되는 특징을 보입니다.
비디오 생성 모델을 넘어 세계 상태와 시각적 렌더링을 분리한 새로운 세계 모델(World Model)을 소개합니다. 이 모델은 지속 가능한 구조화된 환경을 제공하며 사용자와의 상호작용이 가능한 지속적 세계를 지향합니다.

Three.js와 실시간 음성 AI를 결합하여 성당 시대의 장안성을 구현한 3D 인터랙티브 프로젝트입니다. 사용자는 WASD 키로 이동하며 NPC와 실시간 음성으로 대화하고 역사적 미니게임을 즐길 수 있는 오픈 소스 기반의 디지털 문화 체험 환경을 제공합니다.

OpenAI, Bloomberg, HeyGen 등 고가의 유료 AI 서비스를 대체할 수 있는 10가지 오픈소스 프로젝트를 소개합니다. 금융, 비디오 생성, 챗봇 등 다양한 분야의 도구들이 셀프 호스팅을 통해 데이터 제어권을 보장하며 무료로 제공됩니다.

mlx-vlm 프로젝트에 Step 3.7 Flash 모델이 통합되어 Apple Silicon 환경에서 강력한 로컬 멀티모달 성능을 제공합니다. 4-bit 양자화를 통해 Mac Studio에서 초당 53 토큰 이상의 빠른 속도와 32K 컨텍스트를 지원합니다.
Anthropic의 Prompting 101 강의를 통해 실무에 즉시 적용 가능한 프롬프트 엔지니어링 핵심 기법 5가지를 소개합니다. 어조 설정부터 XML 구조 활용, Chain-of-thought까지 체계적인 학습 방법을 안내합니다.

샤오미 MiMo 모델이 추론 시스템 재구축을 통해 API 가격을 대폭 인하했습니다. Hybrid Sliding Window Attention 아키텍처와 캐시 관리 최적화를 통해 KVCache 용량을 압축하고 운영 효율을 극대화했습니다.

Grok-building-0.1 모델이 𝕏 AI API 사용을 지원하기 시작했습니다. 입력 토큰당 약 1달러, 출력 토큰당 약 2달러의 가격 정책이 적용됩니다.
AI가 정답을 즉시 제공하는 방식이 학습자의 인지적 고군분투를 방해하여 학습 효과를 저해한다는 점을 지적합니다. 진정한 교육용 AI는 정답 대신 힌트를 제공하여 사용자가 스스로 사고하도록 유도하는 설계가 필요합니다.
AI 모델의 성능을 높이기 위해 고급 어휘 대신 사전 학습 데이터에서 빈도가 높은 표현을 사용하는 것이 효과적이라는 연구 결과를 소개합니다. 이를 'Adam’s Law(텍스트 빈도 법칙)'라고 정의하며, 모델이 익숙한 확률 공간 내에서 작업하도록 유도하는 전략을 강조합니다.