Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

llama.cpp의 새로운 PR을 통해 x86 CPU에서 Q2_0 양자화 모델의 처리 속도가 3~3.6배 향상되었습니다. AVX-VNNI/AVX-512 VNNI를 활용한 커널 최적화가 핵심이며, AMD EPYC 및 Intel 소비자용 CPU 모두에서 유의미한 성능 개선을 보여줍니다.

LiquidAI의 초소형 모델 LFM2.5-2.6B에 대한 양자화 성능 분석 보고서입니다. 다양한 GGUF 및 KV 캐시 양자화 조합을 통해 메모리 제한 환경에서의 성능 저하를 실험적으로 검증했습니다.
Gemma 4 26b QAT 모델과 최신 Q4_K 양자화 모델을 비교 분석한 결과입니다. QAT가 메모리 효율은 높지만, 정밀도가 중요한 코드 생성 및 창의적 글쓰기 분야에서는 Q4_K 방식보다 성능 퇴보가 발생할 수 있음을 지적합니다.
이 글은 Raspberry Pi 환경에서 작동하는 간단한 로컬 음성 입력 확장 프로그램을 소개합니다. NVIDIA Nemotron 3.5 ASR 0.6B 모델을 활용하여 별도의 서버 없이도 STT 기능을 구현했으며, 사용자가 키보드 단축키로 쉽게 접근할 수 있도록 설계되었습니다.

EschaLabs의 Qwen3.6-35B-A3B-Escha-W2 모델에 대한 벤치마크 분석 결과입니다. 낮은 양자화(W2)를 사용했음에도 불구하고 높은 추론 속도와 뛰어난 성능을 유지하며, 특히 VRAM 효율성이 매우 높음을 확인했습니다.

제한된 하드웨어인 Amazon Echo Dot 2에서 llama.cpp를 활용해 28M 파라미터 규모의 LLM을 로컬로 구동하는 실험 사례를 소개합니다. llama-server를 백그라운드에 상주시키고 KV 캐시를 재사용하여 지연 시간을 획기적으로 단축하는 최적화 방법을 다룹니다.
Dual RTX 3090 환경에서 llama.cpp의 SPLIT_MODE_TENSOR 설정 시 발생하는 프롬프트 처리(PP) 병목 현상을 분석합니다. CPU 샘플러 사용으로 인해 GPU 성능을 제대로 활용하지 못하던 문제를 해결하여 PP t/s를 400에서 1600으로 대폭 향상시킨 사례를 다룹니다.
Ollama, Gemma4, HuggingFace Transformers에서 발견된 프롬프트 인젝션 취약점을 다룹니다. 특수 시퀀스를 이용해 시스템 프롬프트를 탈취할 수 있으며, 멀티 에이전트 환경에서 위험성이 높습니다.

Scotoma-2는 Gemma4를 기반으로 하며, 특정 클리셰(예: 'It's not x, it's y')와 과도한 어시스턴트 페르소나 습관을 줄여 문장력을 개선한 모델입니다. 제작자는 DPO(Direct Preference Optimization) 방식으로 4개의 별도 데이터셋을 구축하여 Gemma4의 고유한 문제점을 타겟팅했습니다.
NVIDIA Nemotron Omni 모델의 비전 및 오디오 타워를 MLX로 직접 구현하여 Mac 환경에서 멀티모달 기능을 완벽하게 지원하도록 만들었습니다. PyTorch 레퍼런스와의 비교 테스트를 통해 높은 정확도를 검증했으며, M5 Max에서 효율적인 추론 속도를 기록했습니다.

다양한 PDF 파싱 도구 8종을 대상으로 14가지 성능 지표를 비교 분석한 결과입니다. Chandra가 표, LaTeX, 고문서 처리에서 압도적인 성능을 보였으나 처리 속도가 느린 것으로 나타났습니다.

vLLM의 서빙 스택을 C++20으로 포팅하여 Python 의존성 없이 66 MiB의 경량 바이너리로 구현한 프로젝트를 소개합니다. 연속 배치 처리 및 추측 디코딩 등 핵심 기능을 포함하며, 기존 vLLM과 대등하거나 소폭 앞서는 성능을 보여줍니다.

BeeLlama.cpp v0.4.0을 사용하여 Qwen 3.6 27B 및 Gemma 4 31B 모델의 KV 캐시 양자화 성능을 벤치마크한 결과입니다. KVarN 및 Precision Tail 기법을 포함한 다양한 양자화 옵션의 메모리 절감 효과와 품질(KLD)을 분석했습니다.

단일 RTX 3090 환경에서 DeepSeek-V4-Flash-0731 모델의 128K 컨텍스트를 유지하며 추론 속도를 최적화하는 방법을 다룹니다. GPU 오프로딩, KV 캐시 양자화, CPU 전문가 배치 등 다양한 설정 조합을 통해 성능을 개선하는 가이드를 제공합니다.

2 x 5070ti 환경에서 Qwen 27B 모델을 최적화하여 실행하는 설정과 성능 통계를 공유합니다. vLLM의 KV 캐시 수정 사항을 통해 생성 속도 저하 없이 동시 스레드 실행과 대규모 컨텍스트 확보가 가능함을 보여줍니다.

NVIDIA가 문서 이미지를 구조화된 텍스트와 레이아웃 정보로 변환하는 Nemotron Parse 2.0 모델을 공개했습니다. 차트 인식 기능과 다국어 지원이 강화되었으며, RAG 및 데이터 추출 워크플로우에 최적화되어 있습니다.
1,001개의 노트를 활용해 32개의 로컬 모델을 대상으로 사실 추출 성능을 직접 비교 테스트한 결과입니다. 대부분의 모델 간 성능 차이가 통계적으로 유의미하지 않았으나, LFM2.5 모델은 크기가 더 작은 모델들에게 성능이 뒤처지는 예외적인 결과를 보였습니다.
로컬 LLM 환경에서 에이전트 프레임워크가 원활하게 작동하도록 설계된 5가지 핵심 전략을 소개합니다. 컨텍스트 관리, 백엔드별 구조화된 출력, 프롬프트 캐싱 최적화 등을 통해 로컬 모델의 한계를 극복하는 방법을 다룹니다.

Rust와 Tauri 기반의 오픈소스 코딩 에이전트인 Clark Code가 공개되었습니다. 오프라인 및 SSH 실행을 지원하며, OpenRouter의 DeepSeek Flash Lite를 활용한 무료 티어를 제공합니다.
로컬 AI 모델 사용을 위해 Alpine.js 기반으로 처음부터 다시 작성된 경량 WebUI 프로젝트를 소개합니다. 불필요한 AI 생성 코드와 무거운 프레임워크를 제거하여 속도와 효율성을 극대화했습니다.