Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Mac Studio 환경에서 Qwen3.5-122B 모델을 실행할 때 발생하는 긴 문맥 프리필 지연 문제를 해결하기 위한 3가지 버그 수정 사례를 공유합니다. qMLX 포크를 통해 KV 캐시 매칭, 중단 경로, 체크포인트 오염 문제를 해결하여 프리필 시간을 분 단위에서 초 단위로 단축했습니다.

Molt는 수백 B 규모의 MoE 모델을 위한 PyTorch 네이티브 RL 사후 학습 프레임워크입니다. 약 9,000라인의 간결한 코드로 구성되어 연구자가 빠르게 실험할 수 있으며, Ray, vLLM, FSDP2를 활용해 대규모 모델 학습을 지원합니다.
Spiritbuun의 llama.cpp 포크에 도입된 VBR(Variable Bit Rate) KV 캐시 기술을 소개합니다. VRAM 예산에 맞춰 컨텍스트 길이에 따라 KV 캐시의 양자화 계층을 동적으로 조절하여 효율적인 메모리 관리를 지원합니다.

1,310만 개의 파라미터를 가진 Conformer 모델을 ESP32-S3 마이크로컨트롤러에서 실행하기 위해 증류 및 양자화 기술을 적용한 프로젝트입니다. 모델 크기를 14MB 플래시 메모리 수준으로 줄여 저가형 하드웨어에서도 오디오 전사가 가능하도록 최적화했습니다.

llama.cpp를 활용하여 GStreamer 내에서 로컬 LLM을 통해 텍스트를 번역 및 변환할 수 있는 플러그인을 소개합니다. Whisper 플러그인과 결합하면 자동 자막 생성 및 번역이 가능하며, 미디어 플레이어나 화상 회의 소프트웨어에 통합하기 용이합니다.
저사양 홈랩 환경에서 Qwen3.6-35B 모델을 활용한 로컬 에이전트가 수학적 난제인 Jacobian 추측에 대한 반증 가능성을 탐색한 사례입니다. 에이전트는 14개의 파이썬 코드를 자율적으로 작성 및 실행하며 복잡한 수학적 계산을 수행했습니다.
KVarN 논문의 기술을 Bonsai 런타임에 포팅하여 27B 모델을 10GB 미만의 VRAM으로 120K 컨텍스트에서 실행하는 방법을 소개합니다. KV 캐시 양자화를 통해 속도는 68% 향상시키고 VRAM 사용량은 획기적으로 줄였습니다.
Prism Bonsai 27B 모델을 실행하기 위한 llama.cpp 컴파일 및 설정 방법을 설명합니다. Mac의 Metal 환경과 CUDA 환경에 맞춘 빌드 명령어와 huggingface-cli를 활용한 모델 다운로드 과정을 다룹니다.
RTX 5090 단일 GPU 환경에서 Qwen3.6 모델의 추론 속도를 극대화하기 위해 설계된 커스텀 C++/CUDA 엔진 NInfer를 공개했습니다. 커스텀 양자화와 커널 최적화 등을 통해 65K 토큰 디코딩 시 543 tok/s라는 압도적인 성능을 달성했습니다.

Unsloth가 AMD 하드웨어를 공식 지원하며 로컬 추론, 미세 조정, 강화학습 및 배포가 가능해졌습니다. Radeon, Instinct GPU 및 AMD CPU를 지원하며 VRAM 사용량을 획기적으로 절감할 수 있습니다.

Trellis.cpp에 사용 편의성을 높인 Studio 기능이 추가되었습니다. 이제 사용자는 복잡한 커맨드 라인 조작 없이도 백엔드 자동 선택, 가중치 자동 다운로드, Three.js 기반의 3D 에셋 프리뷰 기능을 활용할 수 있습니다.

Grok 4.5 기반의 자율 AI 에이전트 Neo를 활용하여 Parakeet CPU ASR 모델의 성능을 최적화한 사례입니다. 자동화된 연구 루프를 통해 인코더의 정적 QDQ MinMax 방식을 찾아냈으며, 결과적으로 STT 처리량을 약 2.1배 향상시켰습니다.
API 속도 제한(Rate Limit) 문제를 해결하기 위해 에이전트를 일시 중단하고 체크포인트를 통해 재개하는 'agentpause' 라이브러리를 소개합니다. KV-cache를 활용한 웜 스타트 방식과 컨텍스트 관리 전략을 통해 재시작 시 발생하는 비용과 시간을 획기적으로 단축할 수 있습니다.
동일한 베이스 모델을 기반으로 한 여러 파인튜닝 체크포인트의 용량을 획기적으로 줄여주는 'deltatensors' 라이브러리를 소개합니다. 베이스 모델과의 가중치 차이(diff)를 계산하고 양자화하여, 모델 품질을 유지하면서도 저장 공간을 약 1/4 수준으로 압축합니다.

지속적인 오디오 입력과 이벤트 기반 인식을 통해 LLM 에이전트의 청각 능력을 확장하는 오픈 소스 프레임워크를 소개합니다. CLAP, Whisper, sqlite-vec 등을 활용하여 로컬에서 실행되며, 사용을 통해 새로운 개념을 학습하고 메모리를 확장하는 구조를 가집니다.

Kimi K2 라인업의 4개 모델을 대상으로 에이전트 기반 버그 수정 능력을 비교 실험했습니다. 모델이 최신일수록 테스트 결과 시뮬레이션의 정확도가 높아지며, 특히 K2.7 Code 모델이 환각 없이 가장 안정적인 성능을 보였습니다.
64GB RAM 환경에서 UD-Q2_K_XL 양자화 기술을 사용하여 Qwen3.5 122B A10B 모델을 구동하는 실험 결과입니다. 속도 저하와 프롬프트 처리 지연이라는 단점이 있지만, 기존 80B 모델보다 훨씬 높은 지식 품질을 얻을 수 있음을 확인했습니다.

llama.cpp와 vLLM을 로컬 환경에서 쉽게 관리할 수 있는 웹 기반 제어판인 LlamaForge를 소개합니다. 복잡한 터미널 명령어나 플래그 설정 없이 브라우저를 통해 모델 빌드, 다운로드, 서버 설정을 직관적으로 제어할 수 있습니다.

안드로이드용 로컬 AI 실행 프로젝트인 AI Doomsday Toolbox v0.948이 업데이트되었습니다. 이번 버전은 여러 안드로이드 기기를 활용한 분산 이미지 및 비디오 생성 기능을 핵심으로 하며, 로컬 AI 클러스터 구축을 지원합니다.
저사양 GPU 환경에서 Qwen3.6-35B-A3B MoE 모델을 30 t/s의 속도로 실행하기 위한 LM Studio 최적화 설정을 공유합니다. KV 캐시는 GPU에 유지하고 MoE 가중치는 CPU RAM으로 오프로드하여 VRAM 부족 문제를 해결하는 것이 핵심입니다.