Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

llama.cpp 팀에서 개발한 공식 Mac용 앱 llama.app과 llama serve를 소개합니다. Ollama와 유사한 사용자 경험을 제공하며, Mac 환경에서 로컬 LLM을 더욱 쉽고 간편하게 설치하고 사용할 수 있도록 지원합니다.
로컬 환경에서 안정적인 웨이크 워드(Wake Word) 시스템을 구축하기 위한 5가지 실무 팁을 제공합니다. 볼륨 튜닝의 함정, 로컬 추론 엔진의 스레드 안전성 문제, 하드웨어 사양 고려 및 오작동 방지 전략을 다룹니다.
llama.cpp의 KV 캐시를 디스크에 저장하여 프로세스 재시작 후에도 프리필(prefill) 속도를 획기적으로 단축하는 최적화 방법을 소개합니다. ARM 서버 환경에서 실험을 통해 TTFT를 개선하고, 추측 디코딩과의 충돌 문제 및 프롬프트 구조화의 중요성을 분석했습니다.
Deepseek v4 flash 모델의 prefill 및 pipeline parallel 속도를 개선하기 위한 CUDA 버전 최적화 방법을 다룹니다. CUDA 13.2 이상의 버전에서 발생하는 DeviceTopK 이슈로 인한 성능 저하를 해결하기 위해 CUDA 13.1로의 다운그레이드를 권장합니다.
vLLM-Moet 2-bit 양자화를 활용하여 단일 DGX Spark 환경에서 DeepSeek-V4-Flash 모델을 실행하는 기술적 방법을 공유합니다. ARM64 아키텍처에서의 빌드 주의사항과 MTP(Multi-Token Prediction) 적용 시의 성능 변화를 다룹니다.
AI의 출력 품질을 높이기 위해 프롬프트, 계획, 기술 등을 체계적으로 작성하고 관리하는 재귀적 규칙 세트 제작 방법을 다룹니다. LLM 특유의 정형화된 문체를 탈피하고 에이전트용 설정 파일(AGENTS.md, CLAUDE.md)을 활용하는 전략을 제안합니다.
콘텐츠 인텔리전스 프레임워크인 Xberg v1이 출시되었습니다. 다양한 문서, 코드, 오디오, 비디오 형식을 처리하며 고성능 PDF 추출 및 OCR 엔진을 제공합니다.
DeepSeek-V4-Flash-0731 모델을 AMD GPU 조합(7900 XTX 및 MI60) 환경에서 llama.cpp로 구동한 성능 테스트 결과입니다. 프롬프트 처리 속도는 최대 140t/s 이상을 기록했으며, 추론 속도는 약 11t/s로 측정되었습니다.
DeepSeek-V4-Flash-0731 모델 사용 시 대화 중간에 시스템 역할을 삽입하면 프롬프트 구조가 망가질 수 있습니다. 대신 모델이 학습된 방식인 'latest_reminder' 역할을 사용하는 것이 권장됩니다.

MoE 모델의 효율적인 구동을 위해 전문가(experts)를 SSD에서 스트리밍하는 독자적인 엔진 'Mference'를 개발했습니다. Gemma 4, Qwen 3.6, DeepSeek-V4-Flash 등 다양한 모델을 지원하며, 저사양 Mac에서도 대규모 모델 실행이 가능하도록 설계되었습니다.
8GB RAM과 단일 CPU 환경에서 Kimi K3 모델을 구동하기 위해 C99로 직접 작성한 경량 추론 엔진을 소개합니다. MoE 아키텍처의 특성을 활용해 전문가 모델을 NVMe에서 스트리밍하는 방식으로 메모리 요구량을 최소화했습니다.
DeepSeek V4 Flash 모델을 로컬 환경(oMLX)에서 설정하며 겪은 도구 호출(tool call) 오류와 캐시 무효화 문제를 다룹니다. Unsloth Studio의 버그와 CPU 폴백 문제, 그리고 핫 캐시 크기 제한으로 인한 성능 저하 해결 과정을 공유합니다.

3xMI50 GPU 환경에서 DS V4-Flash-0731 모델을 로컬로 실행한 성능 테스트 결과입니다. 양자화된 모델을 통해 초당 약 15-16 토큰의 안정적인 생성 속도를 확인했습니다.

RTX 3090 24GB VRAM과 128GB DDR5 RAM 환경에서 DeepSeek-V4-Flash 모델을 구동하는 최적화 방법을 소개합니다. llama.cpp의 --n-cpu-moe 옵션을 활용해 MoE 전문가 일부를 시스템 RAM에 배치함으로써 제한된 VRAM 내에서 대규모 모델을 실행하는 데 성공했습니다.
DeepSeek v4 Flash 0731 모델의 도구 호출(tool calling) 오류를 해결하기 위한 수정 사항이 llama.cpp 프로젝트에 반영되었습니다.

Dual RTX 3060과 96GB RAM 환경에서 Unsloth Studio를 사용하여 DeepSeek V4 Flash 모델을 실행한 벤치마크 결과입니다. RAM 오프로딩을 활용하여 약 3.5 tok/s의 속도를 기록했으며, 저전력 환경에서의 구동 성능을 확인했습니다.

4B 모델을 활용한 분류 작업에서 하네스(harness) 설계 방식에 따라 정확도가 60%에서 82%까지 큰 차이를 보임을 입증했습니다. 프롬프트 내 규칙 배치와 참조 자료 순서 등이 성능에 결정적인 영향을 미친다는 연구 결과를 공유합니다.

오픈 소스 추론 엔진인 TensorSharp가 DeepSeek v4 Flash GGUF 모델을 지원하며, llama.cpp 대비 우수한 성능을 기록했습니다. 4x Nvidia A40 환경에서 TensorSharp의 CUDA 백엔드가 더 높은 prefill 및 decode 속도를 보여줍니다.
NInfer 엔진이 RTX Pro 6000 환경에서 Qwen3.6-27B 모델을 구동할 때 llama.cpp 대비 압도적인 성능 향상을 보임을 입증했습니다. 특히 프리필(prefill) 단계에서 최대 3.53배 빠른 속도를 기록하며 효율적인 추론 성능을 보여줍니다.
Gemma 모델 제품군을 기반으로 MLX M5+ 환경에서 동작하는 Hyperion 커널을 소개합니다. Rust와 Metal 인터페이스를 사용하여 구축되었으며, 현재 12B 모델 최적화에 집중하고 있습니다.