Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Karpathy의 nanoGPT, llm.c, minGPT 등 오픈소스 프로젝트가 커뮤니티의 기여를 통해 하부 구조로서 진화하고 있습니다. FlashAttention 적용, 순수 C 언어 최적화, Llama 아키텍처 재현 등 모델 구현과 훈련 성능을 극대화하는 기술적 발전이 핵심입니다.

Supervisor-Skills는 박사 과정 지도교수의 10년 연구 경험을 AI 스킬 패키지로 구현한 도구입니다. 아이디어 구상부터 문헌 조사, 개요 작성, 벤치마크 설계, 논문 검토 및 최상위 학회 분석까지 구조화된 Prompt/Skill로 제공합니다.
NVIDIA NVlabs에서 로봇 및 물리 세계 에이전트를 위한 초고속 시각적 위치 추정 모델인 LocateAnything를 공개했습니다. 이 오픈소스 도구는 단일 이미지나 비디오에서 물체 지칭, 박스 지정, OCR 등 다양한 작업을 10배 가속된 속도로 수행합니다.

ICML 2026에 발표된 ASASR은 기존 초해상도 기술의 한계인 비현실적인 결과물을 해결하기 위한 오픈소스 모델입니다. Sobolev 기하학과 적대적 정렬 기술을 결합하여 원본의 구조적 충실도를 극대화합니다.
Snap Research가 발표한 Helix4D는 일반 영상을 고품질의 편집 가능한 4D 동적 메쉬로 변환하는 프레임워크입니다. Trellis2 확장을 기반으로 하며, 복잡한 위상 변화나 재질을 포함한 3D 형상과 시간적 변화를 자동으로 생성합니다.
Meituan LongCat 팀이 오디오 기반 디지털 휴먼 영상 제작 모델인 LongCat-Video-Avatar-1.5를 출시했습니다. 기존 모델의 한계였던 립싱크 불일치와 부자연스러운 동작, 긴 영상에서의 글리치 문제를 해결하여 상업적 수준의 아바타 영상을 제작할 수 있습니다.
최근 GitHub에서 자율 학습 AI 에이전트 관련 프로젝트들이 폭발적인 인기를 얻으며 랭킹을 장악하고 있습니다. 이 글은 특히 주목할 만한 다섯 가지 최신 프로젝트를 분석하며, 바이트댄스의 멀티모달 데스크톱 스택부터 금융 특화 에이전트, 그리고 자기 진화 및 코딩 라우팅 도구까지 다양한 분야의 혁신 사례를 소개합니다. 이러한 트렌드는 AI가 단순 대화를 넘어 실제 시스템 조작과 전문적인 업무 수행 단계로 발전하고 있음을 보여줍니다.
3DCellForge는 AI 기반의 인터랙티브 웹 브라우저 스튜디오로, 사용자가 실제 생물학적 세포 구조를 3차원 공간에서 직접 생성하고 탐험할 수 있게 합니다. WebGL을 활용하여 회전, 확대/축소 등 직관적인 조작이 가능하며, 전문 소프트웨어 없이도 상세한 세포 소기관 정보 확인 및 비교 분석 기능을 제공합니다.