Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Search-R1은 LLM이 추론과 검색 엔진 호출을 교차 수행하도록 학습시키는 오픈 소스 강화학습 프레임워크입니다. DeepSeek-R1의 RL 방식을 도구 증강 검색으로 확장하여 Qwen2.5, Llama3 등과 연동됩니다.

Fast-FoundationStereo는 기존 모델 대비 10배 이상 빠른 실시간 프레임 속도를 달성하면서도 높은 정확도의 제로샷 일반화가 가능한 스테레오 매칭 모델군입니다. 지식 증류, 블록별 신경망 구조 탐색, 구조적 가지치기 등의 기법을 활용하여 효율성과 성능을 극대화했습니다.

DeepSpeed는 고급 오프로딩 및 파이프라인 기법을 활용하여 대규모 모델 훈련의 메모리 및 컴퓨팅 비용을 최적화합니다. ZeRO offload, ZenFlow 엔진 등을 통해 LLM 훈련 중 발생하는 메모리 지연을 줄이고, SuperOffload를 이용해 슈퍼칩에서의 대규모 훈련을 지원합니다.
NeuTTS는 3초 분량의 오디오만으로도 기기 로컬 환경에서 즉시 음성 복제가 가능한 TTS 모델들의 오픈소스 컬렉션입니다. 이를 통해 사용자는 별도의 인터넷 연결 없이도 빠르고 간편하게 개인화된 음성 콘텐츠를 제작할 수 있습니다.

Zeek은 프로토콜 전반에 걸쳐 광범위한 애플리케이션 계층 상태를 추적하여 네트워크의 모든 것에 대한 고수준의 의미론적 아카이브를 제공하는 도구입니다. 이 스크립팅 언어는 특정 접근 방식에 얽매이지 않고 사이트별 탐지 정책을 작성할 수 있도록 지원합니다.
mercury 에이전트가 메모리를 처리하는 방식에 대한 분석을 제시합니다. 이 방식은 빠른 검색, 관계적 구조, 충돌 해결 메커니즘 등을 포함하며, 인간의 뇌 구조와 유사한 측면들을 주목할 만하게 다루고 있습니다.

Manim은 Python 코드를 사용하여 정밀하고 프로그래밍 가능한 수학 애니메이션을 제작할 수 있게 해주는 도구입니다. 이 엔진은 유명 교육 채널 3Blue1Brown의 영상 제작에 사용된 것과 동일합니다. `pip install manimgl`로 설치하여 LaTeX 지원 및 OpenGL 기능을 활용한 벡터 그래픽 스크립팅이 가능합니다.

YOLOv8은 단일 모델로 객체 탐지, 분할, 자세 추정 기능을 통합 제공하여 활용도가 높습니다. Ultralytics 레포지토리는 Colab 노트북을 포함하고 있어 사용자가 쉽게 접근하고 테스트할 수 있도록 지원합니다.

Gemma 4 모델을 온디바이스 환경에서 실행하여 개인 정보 보호가 보장되는 오프라인 추론이 가능합니다. 또한, 모델의 단계별 논리(Thinking Mode)를 사용자에게 보여주어 투명성을 높였으며, 모듈식 에이전트 스킬 로딩 기능도 제공합니다.

MiniCPM-V는 1.3B 파라미터 규모임에도 불구하고, Gemma4-E2B-it을 능가하는 성능과 Qwen3.5-0.8B보다 빠른 추론 속도를 보여주었습니다. 이는 내부 ViT(intra-ViT) 초기 압축 기술 덕분에 시각 인코딩 비용을 절반으로 줄였기 가능했습니다.

고정된 활성화 함수 대신 학습 가능한 스플라인을 사용하는 Kolmogorov-Arnold Networks(KANs) 관련 리소스를 정리했습니다. KAN의 이론, 벤치마크, 다양한 프레임워크 구현체 및 튜토리얼을 포함합니다.

OpenArm은 안전한 인간-로봇 상호작용과 재현 가능한 평가를 위해 설계된 오픈 소스 7DOF 휴머노이드 암입니다. 접촉 중심의 물리 AI 연구를 지원하며, 하드웨어와 시뮬레이션 환경을 모두 제공합니다.

BGE-VL은 텍스트-이미지, 이미지-텍스트 등 다양한 조합의 시각적 검색을 지원하는 멀티모달 임베딩 모델입니다. MIT 라이선스로 공개되어 학술 및 상업적 활용이 가능하며, MegaPairs 합성 데이터셋을 통해 학습되었습니다.

nanoGPT는 GPT-2(124M) 성능을 재현할 수 있는 약 300줄 규모의 최소한의 GPT 학습 루프를 제공합니다. 깔끔한 코드베이스를 통해 모델 학습 및 커스텀 데이터셋 학습을 용이하게 지원합니다.
Transformer부터 DeepSeek-R1에 이르기까지 LLM의 발전을 다루는 주요 논문, 프레임워크, 도구들을 정리한 큐레이션 목록입니다. 학습 프레임워크, 추론 도구, 평가 리소스 및 교육 자료를 포괄적으로 제공합니다.

Amphion은 오디오, 음악, 음성 생성 연구를 지원하는 오픈 소스 툴킷입니다. 클래식 모델의 시각화와 재현 가능한 연구 환경을 제공하며, 다양한 생성 태스크와 통합 프레임워크를 포함합니다.

산업 규제로 인해 접근이 어려운 핀테크 LLM 문제를 해결하기 위해 오픈 소스 금융 LLM인 FinGPT를 공개했습니다. 감성 분석과 예측을 위한 모델 및 벤치마크를 포함하며 NeurIPS 등 주요 학회에 채택되었습니다.

Mind Lab이 Zhipu의 GLM-5 시리즈에 대해 전체 사후 학습(Post-training)을 수행한 모델을 Hugging Face에 오픈 소스로 공개했습니다. 이들은 중국의 AI 기술력을 입증할 수 있는 실질적인 결과물을 지속적으로 출시하고 있습니다.

레이블이 없는 Minecraft 게임플레이 영상을 활용하여 모방 학습을 수행하는 Video Pre-Training(VPT) 기술을 소개합니다. 인간의 시연 영상을 통해 행동을 복제하고, 강화학습을 통해 특정 목표를 달성하도록 미세 조정된 모델들을 제공합니다.

PaperGuru는 장기 호라이즌 LLM 에이전트를 위한 새로운 메모리 프리미티브입니다. 이는 네 가지 공리를 가진 생애 주기 인식 메모리(LAM)로 공식화되었으며, PaperBench와 SurveyBench 등 주요 벤치마크에서 높은 성능 향상을 입증했습니다.