Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama.cpp를 포크하여 MoE 모델의 전문가 가중치를 SSD에서 스트리밍하는 기술을 통해, RAM 용량을 초과하는 대규모 모델을 MacBook에서 실행할 수 있게 합니다. Slipstream 앱은 필요한 가중치만 제한된 RAM 캐시로 불러와 성능 저하를 최소화하며 온디바이스 실행을 지원합니다.

WebGPU를 활용하여 브라우저 및 Electron/Tauri 환경에서 LFM 2.5 230M 모델을 초당 1440 토큰의 속도로 구동하는 기술을 소개합니다. Nvidia와 Apple Silicon의 하드웨어 특성에 최적화된 커널을 통해 높은 성능을 구현했습니다.
LLM을 활용한 복잡한 분석 시 신뢰도를 높이기 위해 사용할 수 있는 구조적 분석 및 검증 SOP(표준 운영 절차)를 소개합니다. 질문 고정, 증거 상태 분리, 상충하는 체제 유지 등 논리적 오류를 방지하기 위한 7단계 가이드를 제공합니다.
대화 문맥(Conversational Context)과 구조화된 SOP를 결합하여 AI의 추론 능력을 안정화하는 방법론을 제안합니다. 문맥을 통해 워크플로우를 개발하고, SOP를 통해 이를 압축 및 반복 실행함으로써 모델의 추론 경로를 개선할 수 있습니다.

실제 Three.js 그래픽 구현 과제를 통해 주요 AI 모델들의 코딩 성능을 비교 분석했습니다. 벤치마크 점수 대신 시각적 품질, 애니메이션, 엔지니어링 실행력 등 실질적인 프로젝트 수행 능력을 기준으로 순위를 매겼습니다.
llama.cpp에 도입된 네이티브 MTP(Multi Token Prediction) 기반 투기적 디코딩 기술을 정리합니다. Dense 모델에서는 1.4~2.2배의 성능 향상을 보이지만, MoE 모델에서는 이득이 적거나 거의 없는 것으로 나타났습니다.
CachyLLama는 로컬 에이전트 실행 시 발생하는 프롬프트 처리 병목 현상을 해결하기 위해 SSD 기반 KV 캐싱을 지원하는 llama.cpp 포크입니다. 중급 사양 하드웨어에서 시스템 프롬프트와 대화 기록을 디스크에 저장하여 재사용함으로써 프롬프트 평가 시간을 획기적으로 단축합니다.
API 키 없이 로컬 LLM에서 실행 가능한 50가지 AI 기술(SKILL.md)을 오픈소스로 공개했습니다. 프롬프트 엔지니어링을 넘어선 설명 엔지니어링의 중요성과 MCP 프로토콜 활용, 로컬 실행의 프라이버시 이점 등 1년간의 개발 경험을 공유합니다.

로컬 LLM의 긴 컨텍스트 추론 시 발생하는 KV-cache 메모리 문제를 해결하기 위한 오픈 소스 압축 프레임워크 DKV를 소개합니다. 앵커 기반 표현과 저차원 압축 기술을 통해 메모리 요구 사항을 줄이며, CLI와 MLX/CUDA 백엔드를 지원합니다.

InstructSAM 모델을 llama.cpp 환경에서 실행할 수 있도록 GGUF 형식으로 변환하고 C++로 포팅하는 과정을 다룹니다. 멀티모달 데이터셋 합성 파이프라인을 단순화하기 위해 세그멘테이션 헤드가 통합된 모델을 양자화하여 효율적으로 사용하는 방법을 제시합니다.
OrangePi AI Studio Pro 환경에서 vLLM을 실행하기 위해 rtGetDevMsg 스텁을 구현하여 장치 기능을 모사하는 데 성공했습니다. 이를 통해 torch_npu가 정상 작동하도록 하여 해당 장치에서 vLLM을 활용할 수 있게 되었습니다.

MTP(Multi-Token Prediction)의 성능을 극대화하기 위한 튜닝 방법과 벤치마크 결과를 소개합니다. 모델과 하드웨어 조합에 따라 n_max 설정값이 성능에 큰 영향을 미치며, 모델 제품군별로 최적의 확장성이 다름을 보여줍니다.

GPT 5.6 Sol 에이전트 군집이 Kimi K3 모델의 추론 속도를 65 tok/s에서 406 tok/s로 대폭 최적화했습니다. 에이전트들이 협업하여 연산자 융합 및 새로운 커널 알고리즘을 개발하는 과정을 시각화하여 보여줍니다.
Laguna S2.1 모델을 로컬 환경에서 테스트한 실제 사용 사례를 다룹니다. 이 모델은 일반적인 플래닝 작업에는 부적합하지만, 과도할 정도로 심층적인 추론 스타일 덕분에 복잡한 디버깅 작업에서 탁월한 성능을 보입니다.
이론 물리학과 정보 이론을 결합하여 AI의 사고 체계를 확장하는 'Omega Codex' 프롬프트 프레임워크를 소개합니다. 고밀도 전문 용어와 수학적 구조를 활용해 AI가 양자-계산적 관점에서 문제를 분석하도록 설계되었습니다.

RTX 5060 Ti 환경에서 Qwen3.5 35B 모델을 55 tok/s의 속도로 실행하기 위한 최적화 기법을 소개합니다. Gated Delta Network 커널을 적용하여 기존 llama.cpp의 Q8 양자화 방식보다 훨씬 빠른 성능을 구현했습니다.

audio.cpp 0.4 버전이 출시되어 Higgs Audio v3 TTS 4B 등 고품질 모델 지원과 GGUF 포맷의 전면 도입을 발표했습니다. C++/GGML 기반의 최적화를 통해 실시간 대비 최대 10배 빠른 속도와 VRAM 절감 효과를 제공합니다.

Truss는 편의성과 보안에 초점을 맞춘 새로운 단일 사용자 로컬 하네스입니다. MCP(Model Context Protocol)를 기반으로 작동하며, 워크스페이스 모드를 통해 에이전트에게 안전한 파일 시스템 접근 권한과 도구 사용 환경을 제공합니다.
LLM의 확률적 추론에 의존하는 실행 결정 대신, 사전에 정의된 스키마를 통해 실행 권한을 모델 외부로 이동시키는 설계 원칙을 제안합니다. 존재 기반 검증(Presence-based Verification)을 통해 실행 상태를 표준화하고 제어 가능성을 높이는 방법을 다룹니다.

BigMoeOnEdge 프로젝트를 통해 12GB RAM을 탑재한 Xiaomi 12 Pro에서 Qwen 3.6 35B MoE 모델을 로컬로 실행하는 데 성공했습니다. RAM 제약으로 컨텍스트 길이는 제한적이지만, 엣지 디바이스에서 대규모 MoE 모델을 구동할 수 있음을 입증했습니다.