Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

본문은 사용자가 AI 모델이나 서비스 이용 시, 해당 주체가 봇(bot)인지 아닌지 확인하기 위한 '인간 인증' 또는 '캡차(CAPTCHA)'와 유사한 챌린지를 수행하도록 요청하는 내용을 담고 있습니다. 이는 서비스의 안전성과 보안을 강화하려는 목적입니다.
본 가이드는 3090 또는 유사한 GPU를 사용하여 로컬 환경에서 LLM을 구동하는 방법을 안내합니다. llama.cpp 커스텀 포크와 양자화 모델(IQ4_XS-M-GGUF)을 활용하여, 최대 240K 컨텍스트에서도 높은 처리량(90+ TPS)을 달성할 수 있습니다.
OpenRouter, LM Studio, Google AI Studio 등 다양한 플랫폼의 채팅 기록을 통합 관리하고 검색할 수 있는 로컬 아카이브 'ThreadShelf'를 개발했습니다. 이 도구는 시맨틱/정확 검색 및 연속 사용(MCP) 기능을 제공하여 기존 대화 기록을 효율적으로 활용할 수 있게 합니다.

본 글은 WhatsApp 그룹 채팅 데이터를 활용하여 2B 소형 로컬 LLM을 파인튜닝한 개인적인 경험과 그 결과를 공유합니다. 모델이 실제 대화의 재미와 유사성을 재현하는 데 초점을 맞추었으며, GitHub에 재현 가능한 파이프라인과 평가 방법을 공개했습니다.
Ollama와 llama.cpp를 사용하여 토큰 카운트의 이상 현상을 분석했습니다. Ollama는 컨텍스트 제한에 도달하면 생성을 중단하며, Opencode 인터페이스도 85k로 보고합니다. 반면, llama.cpp는 더 많은 토큰을 처리하는 경향이 있어, Ollama가 특정 상황에서 '컨텍스트 가지치기(context pruning)'를 수행할 가능성이 제기되었습니다.
Radeon AI Pro R9700 단일 GPU 환경에서 vLLM을 사용하여 Qwen3.6 27B 및 35B 모델 구동 결과를 공유합니다. INT4 양자화와 최적 설정을 통해 대용량 컨텍스트 길이(최대 150k)에서도 높은 추론 성능을 유지할 수 있음을 보여줍니다.

RPC 환경에서 300GB 대규모 모델 로딩 속도를 기존 5분에서 1분 30초로 약 300% 단축하는 성능 개선 PR이 제안되었습니다. GGML_RPC_LOAD_THREADS 변수를 활용한 병렬 로딩 최적화가 핵심입니다.
llama.cpp에서 여러 개의 구형 GPU(V620 등)를 사용할 때 발생하는 텐서 분할(tensor split) 오류와 해결 방법을 다룹니다. 특정 마이크로배치 설정 시 발생하는 메모리 버그를 우회하는 팁과 PCIe 대역폭에 따른 성능 변화를 공유합니다.
로컬 RAG 시스템 구축 시 벤치마크 순위보다 검색, 양자화, 하드웨어, 지연 시간 등 실제 제약 조건을 고려한 시스템 설계가 중요함을 강조합니다. 모델 단독 성능보다는 전체 스택의 트레이드오프를 분석하는 접근법을 제안합니다.
WebGPU와 SIMD WASM을 활용하여 브라우저 내에서 NVIDIA Parakeet 모델을 고성능으로 추론하는 구현체입니다. 의존성 없이 커스텀 컴퓨트 셰이더를 사용하여 1시간 분량의 오디오를 20초 만에 전사할 수 있는 빠른 속도를 자랑합니다.
로컬 AI 앱 개발을 위한 하드웨어 감지 기능 구축 과정에서 VRAM 용량별 구동 가능한 모델 성능을 테스트했습니다. GPU 유무 및 VRAM 계층에 따른 모델 실행 가능 범위를 정리하고, 모델 스와핑의 중요성을 강조합니다.
로컬 리소스 도입을 위한 예산 확보를 위해 LLM API 비용 변동성을 시각화하여 증명한 사례를 소개합니다. Anthropic 모델들의 가격 변화를 시각화하여 API 비용 제어의 어려움을 보여줍니다.

llama.cpp의 새로운 PR을 통해 x86 CPU에서 Q2_0 양자화 모델의 처리 속도가 3~3.6배 향상되었습니다. AVX-VNNI/AVX-512 VNNI를 활용한 커널 최적화가 핵심이며, AMD EPYC 및 Intel 소비자용 CPU 모두에서 유의미한 성능 개선을 보여줍니다.
이 글은 Raspberry Pi 환경에서 작동하는 간단한 로컬 음성 입력 확장 프로그램을 소개합니다. NVIDIA Nemotron 3.5 ASR 0.6B 모델을 활용하여 별도의 서버 없이도 STT 기능을 구현했으며, 사용자가 키보드 단축키로 쉽게 접근할 수 있도록 설계되었습니다.

제한된 하드웨어인 Amazon Echo Dot 2에서 llama.cpp를 활용해 28M 파라미터 규모의 LLM을 로컬로 구동하는 실험 사례를 소개합니다. llama-server를 백그라운드에 상주시키고 KV 캐시를 재사용하여 지연 시간을 획기적으로 단축하는 최적화 방법을 다룹니다.
Dual RTX 3090 환경에서 llama.cpp의 SPLIT_MODE_TENSOR 설정 시 발생하는 프롬프트 처리(PP) 병목 현상을 분석합니다. CPU 샘플러 사용으로 인해 GPU 성능을 제대로 활용하지 못하던 문제를 해결하여 PP t/s를 400에서 1600으로 대폭 향상시킨 사례를 다룹니다.
Ollama, Gemma4, HuggingFace Transformers에서 발견된 프롬프트 인젝션 취약점을 다룹니다. 특수 시퀀스를 이용해 시스템 프롬프트를 탈취할 수 있으며, 멀티 에이전트 환경에서 위험성이 높습니다.
NVIDIA Nemotron Omni 모델의 비전 및 오디오 타워를 MLX로 직접 구현하여 Mac 환경에서 멀티모달 기능을 완벽하게 지원하도록 만들었습니다. PyTorch 레퍼런스와의 비교 테스트를 통해 높은 정확도를 검증했으며, M5 Max에서 효율적인 추론 속도를 기록했습니다.

다양한 PDF 파싱 도구 8종을 대상으로 14가지 성능 지표를 비교 분석한 결과입니다. Chandra가 표, LaTeX, 고문서 처리에서 압도적인 성능을 보였으나 처리 속도가 느린 것으로 나타났습니다.

vLLM의 서빙 스택을 C++20으로 포팅하여 Python 의존성 없이 66 MiB의 경량 바이너리로 구현한 프로젝트를 소개합니다. 연속 배치 처리 및 추측 디코딩 등 핵심 기능을 포함하며, 기존 vLLM과 대등하거나 소폭 앞서는 성능을 보여줍니다.