Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
HuggingFace 모델을 macOS 전용 JANG 및 JANGTQ 형식으로 변환하는 네이티브 위저드 도구입니다. Apple Silicon의 MLX 환경에서 대규모 모델을 효율적으로 양자화하고 구동할 수 있도록 최적화된 워크플로우를 제공합니다.
Intel Neural Compressor는 PyTorch, TensorFlow, JAX 등 주요 프레임워크를 지원하는 오픈 소스 모델 압축 라이브러리입니다. 양자화, 혼합 정밀도 등 다양한 기술을 통해 LLM 및 VLM의 효율적인 배포를 지원합니다.
GPTQModel은 다양한 하드웨어 가속을 지원하는 LLM 양자화 및 압축 툴킷입니다. NVIDIA CUDA, AMD ROCm, Huawei Ascend NPU 등 광범위한 하드웨어 지원과 함께 최신 모델들에 대한 지속적인 업데이트를 제공합니다.
KokoroSharp은 ONNX Runtime을 기반으로 구축된 C#용 Kokoro TTS 추론 엔진입니다. NuGet 패키지를 통해 간편하게 통합할 수 있으며, 다양한 언어와 화자를 지원하는 고성능 텍스트 음성 변환 기능을 제공합니다.

Quansloth는 Google의 TurboQuant 기술을 활용하여 로컬 LLM 추론 시 VRAM 사용량을 최대 75%까지 절감하는 오픈소스 프로젝트입니다. 저사양 GPU에서도 대규모 컨텍스트를 안정적으로 처리할 수 있도록 KV 캐시 압축 기술과 최적화된 CUDA 백엔드를 제공합니다.
YOLOv10 모델을 Google AI Edge의 LiteRT(.tflite)로 변환하여 Android 기기에서 실시간 온디바이스 객체 탐지를 구현하는 방법을 설명합니다. PyTorch에서 ONNX를 거쳐 TFLite로 변환하는 전체 파이프라인과 Android 앱에서의 추론 및 시각화 과정을 다룹니다.
KV 압축 기술을 통해 소비자용 하드웨어에서도 대규모 컨텍스트를 처리할 수 있게 하는 quantcpp 라이브러리를 소개합니다. 6.4배의 KV 압축을 통해 메모리 사용량을 획기적으로 줄이면서도 FP32 수준의 품질을 유지합니다.
pmetal은 Rust로 작성된 Apple Silicon 전용 머신러닝 플랫폼으로, Metal GPU와 Apple Neural Engine(ANE)을 활용합니다. GUI와 TUI를 모두 지원하며 모델 학습, 추론, 양자화, 지식 증류 등 통합적인 ML 워크플로우를 제공합니다.
Camelid는 Rust로 구현된 네이티브 로컬 LLM 추론 엔진으로, GGUF 모델을 직접 로드하여 OpenAI 스타일의 API를 제공합니다. Python 의존성 없이 단일 정적 바이너리로 동작하며, Metal GPU 가속과 엄격한 토큰 단위 일치성 검증을 특징으로 합니다.
NVIDIA Model Optimizer(ModelOpt)는 양자화, 가지치기, 증류 등 최첨단 기술을 통해 AI 모델을 가속화하는 라이브러리입니다. Hugging Face, PyTorch와 호환되며 TensorRT-LLM, vLLM 등 추론 프레임워크로의 원활한 배포를 지원합니다.
LLM 추론 시스템 최적화를 위한 핵심 리소스를 큐레이션한 자료입니다. 서빙 엔진 비교, GPU 커널, 양자화, MoE 모델 분석 및 비용 절감 전략 등 엔지니어링 관점의 심도 있는 주제들을 다룹니다.
Tensorflow의 Object Detection API와 SSD 신경망을 사용하여 1인칭 시점(egocentric view)의 손을 탐지하는 기술 가이드입니다. Egohands 데이터셋을 활용하여 실시간 웹캠 및 유튜브 영상에서 손을 추적하는 방법과 코드를 제공합니다.
Lotti는 로컬 에이전틱 레이어를 갖춘 오픈 소스 개인 로그북입니다. 지속적으로 실행되는 AI 에이전트가 사용자의 기록을 분석하여 다음 할 일을 제안하며, 개인정보 보호를 위해 로컬 실행 및 종단간 암호화를 지원합니다.
lukasHoel/3DGS-LM은 ICCV 2025 논문으로 발표된 오픈소스 프로젝트로, 3D Gaussian Splatting (3DGS) 렌더링 파이프라인의 핵심인 최적화 단계를 획기적으로 가속화합니다. 기존에 널리 쓰이던 ADAM 옵티마이저를 Levenberg-Marquardt 알고리즘으로 대체하여 수렴 속도를 높이고, CUDA 기반 고성능 연산을 통해 3D 재구성 작업의 효율성을 극대화합니다.
TL;DR: erkkimon/vllama 는 Ollama 의 간편한 모델 관리 기능과 vLLM 의 초고속 GPU 추론 성능을 하나로 통합한 오픈소스 하이브리드 서버입니다. OpenAI 호환 API 를 제공하므로 기존 클라이언트 코드 변경 없이 최적화된 성능으로 LLM 을 실행할 수 있습니다.
BASPACHO 는 비선형 최적화 문제를 해결하기 위해 설계된 C++ 기반 라이브러리로, 희소 대칭 양정치 (SPD) 행렬에 특화된 직접 솔버입니다. 이 프로젝트는 계산 효율성을 극대화하기 위해 슈퍼노달 콜레스키 분해 알고리즘을 구현했으며, 가속화를 위해 NVIDIA CUDA 를 통한 GPU 지원도 제공합니다. 대규모 최적화 문제를 다루는 엔지니어와 연구자에게 유용한 도구입니다.
기하대수 (Geometric Algebra, GA) 알고리즘을 C++, OpenCL, CUDA 등 다양한 플랫폼의 고품질 코드로 변환하고 최적화하는 오픈소스 도구인 Gaalop 를 소개합니다. Christian Perwass 의 CLUCalc 로 작성된 복잡한 기하대수 표현식을 컴파일러가 자동으로 단순화하여 하드웨어 가속 (AMP) 이나 병렬 처리에 적합한 형태로 변환해 줍니다.
CUDA-L1 는 강화학습 (Reinforcement Learning) 을 활용해 CUDA 코드의 성능을 극대화하는 오픈소스 프로젝트입니다. 기존 수동 튜닝의 한계를 넘어, 대조적 강화학습 기법을 통해 자동으로 최적화된 커널을 생성합니다. Python 기반이며 현재 GitHub 에서 298 개의 스타를 받으며 주목받고 있습니다.
CUDA 및 OpenCL 기반 GPU 컴퓨팅 성능을 극대화하기 위한 자동 튜닝 도구인 KernelTuner를 소개합니다. Python으로 작성된 이 프로젝트는 C/C++ 코드를 통해 구현된 GPU 커널의 파라미터를 자동으로 최적화하여, 개발자가 수동으로 시행착오를 겪지 않고도 최고의 성능을 끌어낼 수 있도록 지원합니다.
NVIDIA의 NCCL(Non-blocking Collective Communication Library) 는 고성능 컴퓨팅(HPC) 및 딥러닝 훈련에 필수적인 다중 GPU 간 집단 통신을 위한 최적화된 기본 연산들을 제공합니다. C++ 로 작성된 이 오픈소스 라이브러리는 CUDA 기반의 비동기적 통신 원시 함수(primitives) 를 포함하며, 데이터 병목 현상을 줄이고 대규모 모델 학습 속도를 극대화하는 데 핵심적인 역할을 합니다.