Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
SkillOpt는 모델 가중치를 수정하지 않고도 에이전트의 기술(skills)을 딥러닝 옵티마이저처럼 훈련할 수 있는 프레임워크입니다. SkillOpt-Sleep 기능을 통해 야간 오프라인 자기 진화가 가능하며, Claude Code, Codex, Copilot 등 다양한 코딩 도구와 통합됩니다.
Chandra OCR 2는 레이아웃 정보를 보존하며 이미지와 PDF를 HTML, Markdown, JSON 등 구조화된 데이터로 변환하는 최첨단 OCR 모델입니다. 90개 이상의 언어와 수학, 표, 필기체 등을 지원하며 olmocr 벤치마크에서 높은 성능을 입증했습니다.
코딩 에이전트를 위한 로컬 및 결정론적 기술 스택 구성 도구인 AAS(Agentic Awesome Skills) V15.0.0을 소개합니다. 에이전트가 프로젝트 프로필을 기반으로 기술 스택을 제안하고, 사용자가 CLI를 통해 검증 및 계획을 검토할 수 있는 에이전트 우선(Agent-First) 환경을 제공합니다.
graphify는 프로젝트의 코드, 문서, 미디어 등을 지식 그래프로 매핑하여 AI 코딩 어시스턴트가 프로젝트 전체를 이해하도록 돕는 도구입니다. 벡터 인덱스가 아닌 실제 탐색 가능한 그래프를 구축하여, 파일 검색 대신 질의응답과 경로 추적이 가능합니다.
FastAPI, React, Playwright를 활용하여 구축된 시엔위(Xianyu) 다중 계정 자동화 시스템입니다. 계정 관리, 메시지 자동 답장, 상품 게시 및 커미션 관리 기능을 포함한 통합 백엔드/프론트엔드 아키텍처를 제공합니다.
CVPR 2024에 발표될 FoundationPose는 모델 기반 및 모델 프리 설정을 모두 지원하는 통합 6D 객체 포즈 추정 및 추적 파운데이션 모델입니다. 미세 조정 없이도 새로운 객체에 즉시 적용 가능하며, BOP 리더보드 1위를 기록하며 강력한 일반화 성능을 입증했습니다.
OmniVoice-Studio는 클라우드나 API 키 없이 로컬 기기에서 실행되는 오픈 소스 음성 AI 도구입니다. 646개 언어를 지원하며 실시간 받아쓰기, 제로샷 음성 복제, 비디오 더빙 기능을 제공합니다.
Claude Code 환경에서 실행되는 장편 웹소설 창작 전문 플러그인입니다. 단순 생성을 넘어 캐릭터 설정, 복선, 세계관의 일관성을 유지하며 장기적인 집필 프로세스를 관리하는 시스템을 제공합니다.
Kimi CLI는 터미널에서 작동하는 AI 에이전트로, 코드 편집, 쉘 명령 실행, 웹 검색 등 개발 작업을 지원합니다. 이는 단순 코딩 도구를 넘어선 통합 쉘 역할을 수행하며, VS Code 확장 및 Zsh 플러그인 등을 통해 다양한 환경에 깊숙이 통합될 수 있습니다.
Apache Ossie는 데이터 분석, AI, BI 생태계 전반의 의미론적 모델 교환을 표준화하는 오픈 소스 프로젝트입니다. 이 벤더 중립적인 표준은 모든 도구 간에 일관된 '단일 진실 공급원'을 제공하여, KPI 정의 불일치나 비즈니스 로직 오류로 인한 문제를 해결합니다.
GraphRAG는 LLM을 활용하여 비정형 텍스트에서 의미 있는 구조화된 데이터를 추출하는 데이터 파이프라인입니다. 이 시스템은 지식 그래프 메모리 구조를 사용하여 LLM의 추론 능력을 향상시키는 방법론을 제시합니다. 사용자는 최적의 결과를 위해 프롬프트 미세 조정(Prompt Tuning)을 강력히 권장받고 있으며, 버전 관리를 위한 명확한 가이드라인도 제공됩니다.
DSPy는 언어 모델을 프롬프팅하는 대신 프로그래밍할 수 있게 해주는 프레임워크입니다. 이를 통해 간단한 분류기부터 복잡한 RAG 파이프라인, 에이전트 루프까지 모듈식 AI 시스템을 빠르게 구축하고 반복할 수 있습니다. DSPy는 Python 코드를 작성하여 LM의 출력을 학습시키고 최적화합니다.
LLM 애플리케이션 개발자를 위한 RAG(검색 증강 생성) 기술 풀스택 튜토리얼 프로젝트입니다. 데이터 처리부터 인덱스 구축, 검색 최적화, 멀티모달 지원까지 체계적인 학습 경로와 실무 프로젝트를 제공합니다.
Karpathy의 nanoGPT 저장소는 중간 크기의 GPT 모델을 빠르고 단순하게 훈련 및 미세 조정할 수 있는 도구입니다. 실용성을 강조하여 설계되었으며, GPT-2 수준의 모델을 재현하거나 사용자 맞춤형 모델을 구축하기에 용이합니다.
Douyin의 동영상, 이미지, 음악, 프로필 등을 일괄 다운로드할 수 있는 실용적인 도구입니다. 데스크톱 GUI와 REST API 서버 모드를 지원하며, SQLite를 통한 중복 제거 및 OpenAI API를 활용한 비디오 전사 기능을 제공합니다.
Microsoft Fabric Skills는 GitHub Copilot CLI 및 AI 코딩 도구가 Microsoft Fabric의 워크로드와 모범 사례를 이해하도록 돕는 재사용 가능한 AI 지침 세트입니다. 사용자는 목적에 따라 제작, 소비, 운영 등 특정 기능에 특화된 번들을 설치하여 활용할 수 있습니다.
VideoAgent는 비디오 이해, 편집, 생성을 통합한 멀티모달 에이전트 프레임워크입니다. 사용자의 자연어 명령을 분석하여 자율적으로 도구를 사용하고 워크플로우를 계획함으로써 복잡한 비디오 제작 과정을 자동화합니다.
기술 서적이나 문서를 에이전트가 즉시 활용 가능한 구조화된 '기술(Skill)'로 변환해주는 도구입니다. 토큰 사용량을 최대 51배 절감하며, Claude Code나 GitHub Copilot CLI 등에서 환각 없이 정확한 정보를 참조할 수 있게 합니다.

VulnClaw는 자연어 입력을 통해 정보 수집부터 취약점 이용, 보고서 생성까지 침투 테스트 전 과정을 자동화하는 AI 에이전트 CLI 도구입니다. LLM 에이전트와 MCP 툴체인을 결합하여 목표 기반의 검색 엔진과 환각 방지 메커니즘을 제공합니다.

LingBot-Map은 스트리밍 3D 재구성을 위한 피드포워드 3D 파운데이션 모델입니다. 기하학적 컨텍스트 트랜스포머를 통해 장거리 드리프트 보정과 고효율 스트리밍 추론을 지원하며, 대규모 프레임 시퀀스에서도 안정적인 성능을 제공합니다.