Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

llama.cpp 팀에서 개발한 공식 Mac용 앱 llama.app과 llama serve를 소개합니다. Ollama와 유사한 사용자 경험을 제공하며, Mac 환경에서 로컬 LLM을 더욱 쉽고 간편하게 설치하고 사용할 수 있도록 지원합니다.
중국 LLM의 정치적 편향성을 정량적으로 평가하기 위한 CCPBench를 소개합니다. 29개의 오픈 소스 모델을 대상으로 정치, 지리, 과학 분야의 질문을 던져 Gemini 1.5 Flash를 통해 편향성을 측정했습니다.

LM Studio 패치 이후 M1 Ultra 128GB 환경에서 DeepSeek V4 IQ3XXS 모델을 구동하여 초당 16토큰의 속도를 기록했습니다.
EdgeRazor는 엔트로피 가이드 증류를 활용하여 저비트 및 혼합 정밀도 환경에서 모델 성능을 극대화하는 새로운 양자화 기술입니다. 기존 QAT보다 효율적이면서도 매우 낮은 비트(최저 1.88비트)에서도 교사 모델의 역량을 효과적으로 보존합니다.
로컬 환경에서 안정적인 웨이크 워드(Wake Word) 시스템을 구축하기 위한 5가지 실무 팁을 제공합니다. 볼륨 튜닝의 함정, 로컬 추론 엔진의 스레드 안전성 문제, 하드웨어 사양 고려 및 오작동 방지 전략을 다룹니다.
llama.cpp의 KV 캐시를 디스크에 저장하여 프로세스 재시작 후에도 프리필(prefill) 속도를 획기적으로 단축하는 최적화 방법을 소개합니다. ARM 서버 환경에서 실험을 통해 TTFT를 개선하고, 추측 디코딩과의 충돌 문제 및 프롬프트 구조화의 중요성을 분석했습니다.

OpenRouter에서 제공하는 다양한 Qwen 모델 시리즈에 대해 35개의 프롬프트를 활용한 원샷(oneshots) 비교 테스트를 수행했습니다. 총 1,109개의 출력값을 생성하여 Qwen 2.5부터 최신 Qwen 3 시리즈까지의 성능을 검토한 결과물을 공유합니다.
DeepSeek-V4-Flash-0731 모델의 네 가지 추론 노력 모드(None, Low, High, Max)에 따른 토큰 사용량과 성능을 비교 분석했습니다. 실험 결과 'Low' 모드가 예상과 달리 매우 장황한 출력을 생성하는 특이 현상이 발견되었습니다.
Deepseek v4 flash 모델의 prefill 및 pipeline parallel 속도를 개선하기 위한 CUDA 버전 최적화 방법을 다룹니다. CUDA 13.2 이상의 버전에서 발생하는 DeviceTopK 이슈로 인한 성능 저하를 해결하기 위해 CUDA 13.1로의 다운그레이드를 권장합니다.
vLLM-Moet 2-bit 양자화를 활용하여 단일 DGX Spark 환경에서 DeepSeek-V4-Flash 모델을 실행하는 기술적 방법을 공유합니다. ARM64 아키텍처에서의 빌드 주의사항과 MTP(Multi-Token Prediction) 적용 시의 성능 변화를 다룹니다.

Mac 환경에서 실행 가능한 Deepseek-V4-Flash-0731 Dwarfstar 모델에 관한 내용입니다. 해당 모델의 로컬 실행 가능성을 다룹니다.
AI의 출력 품질을 높이기 위해 프롬프트, 계획, 기술 등을 체계적으로 작성하고 관리하는 재귀적 규칙 세트 제작 방법을 다룹니다. LLM 특유의 정형화된 문체를 탈피하고 에이전트용 설정 파일(AGENTS.md, CLAUDE.md)을 활용하는 전략을 제안합니다.

Deepseek v4 pro 등 대규모 오픈 모델을 로컬에서 실행하기 위해 16xGB10 클러스터를 구축하는 과정을 설명합니다. 고속 네트워크 연결을 통해 2T+ 규모의 모델 실행 가능성을 목표로 합니다.
Hugging Face의 safetensors 헤더 계산 방식을 이용해 실제 데이터 없이 16.5조 개의 파라미터를 선언한 'Vacuum 16T' 모델 사례를 분석합니다. 이 모델은 실제 데이터 전송량은 매우 적지만, 선언된 논리적 크기에 따라 저장 용량 할당량을 모두 소비하는 구조를 보여줍니다.
콘텐츠 인텔리전스 프레임워크인 Xberg v1이 출시되었습니다. 다양한 문서, 코드, 오디오, 비디오 형식을 처리하며 고성능 PDF 추출 및 OCR 엔진을 제공합니다.
DeepSeek-V4-Flash-0731 모델을 AMD GPU 조합(7900 XTX 및 MI60) 환경에서 llama.cpp로 구동한 성능 테스트 결과입니다. 프롬프트 처리 속도는 최대 140t/s 이상을 기록했으며, 추론 속도는 약 11t/s로 측정되었습니다.
DeepSeek-V4-Flash-0731 모델 사용 시 대화 중간에 시스템 역할을 삽입하면 프롬프트 구조가 망가질 수 있습니다. 대신 모델이 학습된 방식인 'latest_reminder' 역할을 사용하는 것이 권장됩니다.

MoE 모델의 효율적인 구동을 위해 전문가(experts)를 SSD에서 스트리밍하는 독자적인 엔진 'Mference'를 개발했습니다. Gemma 4, Qwen 3.6, DeepSeek-V4-Flash 등 다양한 모델을 지원하며, 저사양 Mac에서도 대규모 모델 실행이 가능하도록 설계되었습니다.
8GB RAM과 단일 CPU 환경에서 Kimi K3 모델을 구동하기 위해 C99로 직접 작성한 경량 추론 엔진을 소개합니다. MoE 아키텍처의 특성을 활용해 전문가 모델을 NVMe에서 스트리밍하는 방식으로 메모리 요구량을 최소화했습니다.
DeepSeek V4 Flash 모델을 로컬 환경(oMLX)에서 설정하며 겪은 도구 호출(tool call) 오류와 캐시 무효화 문제를 다룹니다. Unsloth Studio의 버그와 CPU 폴백 문제, 그리고 핫 캐시 크기 제한으로 인한 성능 저하 해결 과정을 공유합니다.