Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Meta의 SAM 2는 이미지와 비디오 모두에서 프롬프트 기반 시각적 분할을 수행하는 파운데이션 모델입니다. 스트리밍 메모리를 갖춘 트랜스포머 아키텍처를 통해 실시간 비디오 처리가 가능하며, 대규모 SA-V 데이터셋을 통해 학습되었습니다.
The Well은 생물학, 유체 역학, 천체 물리학 등 다양한 물리 시스템의 수치 시뮬레이션을 포함하는 15TB 규모의 대규모 머신러닝 데이터셋 컬렉션입니다. 도메인 과학자들과 협력하여 구축되었으며, 계산 과학 연구 및 모델 학습을 위한 벤치마크로 활용될 수 있습니다.
Roblox가 3D 지능 구현을 위한 오픈 소스 모델 제품군인 CubePart를 공개했습니다. CubePart는 오픈 보캐블러리 및 부품 제어 기능을 통해 텍스트와 메쉬를 기반으로 정교한 3D 에셋을 생성하며, 게임 엔진에 즉시 통합 가능한 수준의 결과물을 제공합니다.
Qwen3-Omni는 텍스트, 이미지, 오디오, 비디오를 모두 처리하는 네이티브 엔드투엔드 다국어 옴니모달 파운데이션 모델입니다. 실시간 스트리밍 응답과 저지연 상호작용을 지원하며, 다수의 벤치마크에서 SOTA 성능을 기록했습니다.
CVPR 2024에 채택된 4DGaussians는 동적 장면을 효율적으로 렌더링하기 위한 새로운 Gaussian Splatting 기법을 제안합니다. 기존 방식보다 훈련 시간을 대폭 단축하면서도 고품질의 4D 렌더링 성능을 유지합니다.
VQAScore는 텍스트-비주얼 생성 모델을 자동으로 평가하는 프레임워크로, 최근 비디오 기반 모델 지원 및 CameraBench 통합 업데이트를 완료했습니다. Google의 Imagen3 등 주요 기업에서 CLIPScore의 강력한 대안으로 채택하며 그 성능을 입증했습니다.
Andrej Karpathy가 공개한 micrograd는 역전파를 구현한 매우 작은 규모의 자동 미분(Autograd) 엔진입니다. 약 100줄의 코드로 구성된 DAG 기반의 라이브러리로, 교육용으로 설계되어 신경망의 동작 원리를 이해하는 데 최적화되어 있습니다.
SakanaAI가 개발한 'The AI Scientist'는 LLM을 활용하여 아이디어 생성부터 논문 작성까지 과학적 연구 과정을 자율적으로 수행하는 최초의 포괄적 시스템입니다. 이 시스템은 독립적인 연구 수행을 목표로 하며, 다양한 연구 주제에 대한 논문 생성 및 리뷰 실험 결과를 제공합니다.
DINOv3는 다양한 비전 작업에서 미세 조정 없이도 최첨단 성능을 발휘하는 다재다능한 비전 파운데이션 모델 제품군입니다. 고해상도 밀집 특징을 생성하며, ViT 및 ConvNeXt 백본을 지원하고 Hugging Face Transformers 및 timm 라이브러리와의 호환성을 제공합니다.
이 저장소는 RAG(Retrieval-Augmented Generation) 시스템의 정확성, 효율성 및 문맥적 풍부함을 향상시키는 최첨단 기술과 고급 튜토리얼 컬렉션을 제공합니다. 여기에는 MemoRAG, End-to-End RAG Evaluation 등 다양한 최신 개선 사항이 포함되어 있습니다. 또한, 사용자는 프롬프트 엔지니어링 기초를 다지고 프로덕션급 GenAI 에이전트를 구축하는 방법을 배우기 위해 관련 리소스(Agents Towards Production, Prompt Engineering Techniques guide)도 함께 제공받을 수 있습니다.
Qwen3-VL은 기존 Qwen 시리즈 중 가장 강력한 시각-언어 모델(VLM)으로, 텍스트 이해/생성, 시각적 인지 및 추론, 컨텍스트 길이, 공간/비디오 역학 이해 등 전반적인 면에서 대폭 업그레이드되었습니다. 이 모델은 에지부터 클라우드까지 확장 가능한 Dense 및 MoE 아키텍처로 제공되며, 시각적 에이전트 기능(GUI 작동), 이미지/비디오 기반 코딩 생성, 고급 공간 인지(3D 그라운딩 포함) 등 다양한 첨단 기능을 갖추고 있습니다. 또한 256K 네이티브 컨텍스트를 지원하며, STEM 분야의 강화된 멀티모달 추론 능력을 제공합니다.
본 문서는 OpenAI Agents SDK, CrewAI, LangGraph, AutoGen 및 MCP를 활용하여 Agentic AI(에이전트형 AI)를 코딩하고 배포하는 6주간의 학습 여정을 안내합니다. 이 과정은 강력한 에이전트 시스템 구축 방법을 다루며, 참가자들에게 필요한 환경 설정 지침과 다양한 실습 옵션을 제공합니다. 특히 Windows 사용자들을 위한 특정 설치 문제 해결 방법(Microsoft Build Tools 설치 및 `uv tool install` 명령어 사용)을 상세히 설명하고 있으며, API 키 관리와 비용 모니터링의 중요성을 강조합니다.
이 저장소는 fastai와 PyTorch를 사용하여 딥러닝 입문부터 고급 주제까지 다루는 노트북 시리즈입니다. 이 자료들은 MOOC(Massive Open Online Course)의 일부로 사용되었으며, 초보자도 쉽게 접근할 수 있도록 Google Colab 환경에서 작업하는 것을 권장합니다. 커버하는 내용은 MNIST 기본기부터 멀티모달 데이터 처리, NLP 등 광범위한 AI 응용 분야를 포함하고 있습니다.
이 리포지토리는 초보자를 위해 설계된 '생성형 AI' 학습 자료 모음입니다. 총 21개의 Jupyter Notebook 형식의 레슨을 통해 사용자가 생성형 인공지능의 기본 개념부터 실습까지 체계적으로 배울 수 있도록 구성되어 있습니다. 따라서 프로그래밍 지식이 부족한 입문자도 따라 하기 쉬운 환경에서 AI 기술을 습득할 수 있습니다.
Chip Huyen 저자의 최신 책 'AI Engineering'(2025) 을 위한 공식 지원 자료와 AI 엔지니어링 리소스가 모인 Jupyter Notebook 기반의 오픈소스 프로젝트입니다. 현재 활발히 개발 중(WIP)이며, 주별 트렌딩 수치가 +614000 으로 급증하여 커뮤니티의 높은 관심을 받고 있습니다.