Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
오픈소스 스크린 모니터링 앱 'Observer'가 사용자 피드백을 바탕으로 대폭 개선되었습니다. 초기에는 설정이 복잡하고 수동적이었으나, 이제는 간단한 문장 입력만으로도 앱이 스스로 제어할 만큼 사용성이 향상되었습니다.
작은 LLM의 도구 호출 성공률을 높이기 위해 여러 가지 최적화 기법을 적용했습니다. 주요 방법으로는 노출되는 도구의 개수를 줄이고, 기능별로 그룹화하며, 도구 매개변수의 규칙을 완화하는 것입니다. 이러한 접근 방식은 컨텍스트 크기를 크게 줄여 성능과 속도를 개선하고 에이전트의 안정성을 높였습니다.

llama.cpp용 명령어 빌더인 llamacalc가 대규모 업데이트를 통해 다양한 운영체제 및 환경을 지원합니다. Linux/macOS 명령어, Windows PowerShell, Command Prompt 등 여러 플랫폼의 명령어를 생성할 수 있으며, 초보자 프리셋과 충돌 경고 기능이 추가되었습니다.
GPU 사양이 낮은 환경에서 느린 프롬프트 처리(PP) 속도를 개선하기 위한 원격 처리 방법을 제안합니다. 충분한 VRAM을 가진 고성능 GPU를 활용하여 대용량 프롬프트를 미리 처리하고, 이를 저장하여 호스트 기기로 전송한 후 토큰 생성을 시작하는 방식입니다.

개발자가 SearXNG 기능을 서브 에이전트로 구현하여 작업 공간 도구에 통합한 사례를 공유합니다. 이 에이전트는 WebResearch 래퍼를 통해 호출되며, 웹 검색과 가져오기 기능만을 사용하여 규칙 기반의 마크다운 보고서를 생성하는 것이 특징입니다.

로컬 환경에서 Huggingface speech-to-speech 및 Qwen3.6 모델을 활용하여 학습 도구를 구축하는 방법을 소개합니다. 이 시스템은 사용자가 개념을 설명하면, AI가 해당 지식의 '지식 발판(knowledge scaffolding)' 목록을 컴파일하고 사용자에게 추가 설명을 요청하여 학습 효과를 극대화합니다.

DFlash 기술은 Qwen3.6 27B 모델의 추론 속도를 최대 2.2배 향상시키는 방법을 제시합니다. 이 테스트는 quicksort, JSON 생성 등 구조화된 작업에서 DFlash가 매우 빠르지만, 창의적 글쓰기 같은 작업에서는 MTP 방식이 더 안정적임을 보여줍니다.
PHP CMS 프로젝트의 Queue 서브시스템 탐색을 목표로 한 자체 벤치마크 결과를 분석한 내용입니다. 여러 모델(gemma-4, qwen3.5/3.6 등)이 주어진 도구 세트와 시스템 프롬프트에 따라 코드베이스를 탐색하며 답변했습니다. 그 결과, 높은 점수를 받은 qwen3.6-35b-a3b@q5_k_xl과 gemma-4-26b-a4b-it-qat가 가장 정확하고 포괄적인 요약을 제공했음을 보여줍니다.

Huggingface의 모델 저장소(repo)를 사용자의 계정으로 쉽게 복제할 수 있는 도구인 HuggingMirror를 개발했습니다. 이 로컬 실행 도구는 URL을 입력하면 현재 스냅샷을 다운로드하여 사용자 HF 계정에 업로드하고, 진행 상황을 보여줍니다.
대용량 Hugging Face 모델(GGUF/safetensors) 다운로드 실패 문제를 해결하기 위해 단일 정적 Go 바이너리인 hftools를 제작했습니다. 이 도구는 재개 가능한 다운로드, 에어 갭 환경을 위한 해시 검증, 그리고 다양한 캐시 레이아웃 간의 변환 기능을 제공합니다.

로컬 LLM 환경에서 작동하는 새로운 지식 그래프 'Cortex'를 발표했습니다. Cortex는 단순 텍스트 패턴 인식의 한계를 넘어, 구조화된 지식과 복잡한 관계를 이해하고 추론할 수 있도록 설계되었습니다. 이를 통해 RAG 시스템을 보완하여 정확도와 성능을 획기적으로 향상시킬 수 있습니다.

이 플러그인은 Obsidian 볼트 내의 노트와 문서 전반에 걸쳐 질문하고 답변을 얻기 위해 로컬 AI 환경을 활용합니다. 클라우드 전송 없이 사용자의 기기에서 모델을 실행하며, 자체 노트 기반의 답변과 출처 인용 기능을 제공합니다.
Graphene OS 환경에서 Hermes를 구동한 후기를 공유하며, 원격 게이트웨이와 로컬 LLM(Llama.cpp, Qwen 3.6 35b)을 결합한 고성능 세팅을 소개합니다. 휴대용 GPU와 eGPU 조합으로 높은 프롬프트 및 생성 처리 속도를 달성했으며, 전체 시스템이 100% 로컬로 작동하는 점을 강조했습니다.
llama.cpp가 SYCL 및 Intel 관련 최신 업데이트를 제공하며, 여러 성능 향상과 기능 개선이 이루어졌습니다. 특히 Flash Attention을 통한 XMX 엔진 사용, Qwen3.6-27b 모델의 프리필 속도 대폭 향상 등이 포함되었습니다.
이 프로젝트는 서버나 WebGPU에 의존하지 않고, 순수 WebAssembly(WASM)를 사용하여 3억 5천만 개 매개변수의 LLM을 브라우저에서 완전히 온디바이스로 실행하는 방법을 제시합니다. 모델은 4비트로 양자화되었으며, WASM SIMD 커널과 배치 사전 채우기 기능을 포함하여 네이티브 백엔드 없이도 효율적인 추론이 가능합니다.

Supertonic 3 모델을 포함한 여러 TTS 모델이 C++/GGML 기반의 audio.cpp를 통해 높은 성능으로 구현되었습니다. 특히 RTX 5090 환경에서 10시간 분량의 오디오를 약 3분 만에 생성하는 등 압도적인 속도를 보여주었습니다. C++ 버전은 Python보다 빠르며, ONNX 사용 시 GPU 활용도가 떨어지는 문제점을 개선했습니다.
본 글은 colibrì 엔진을 사용하여 GPU 없이도 대규모 MoE 모델인 GLM-5.2 (744B)를 로컬 단일 컴퓨터에서 구동하는 실습 과정을 다룹니다. 핵심 원리는 필요한 전문가(expert)만 디스크에서 RAM으로 스트리밍하여 메모리 부담을 줄이는 것입니다. 이 엔진은 사용 시간이 길어질수록 성능이 향상되는 특징을 보여줍니다.
CUDA GPU 환경에서 llama.cpp를 직접 설정하고 사용하는 과정에서 발생하는 복잡한 오류 문제를 다루고 있습니다. 이 글은 LM Studio의 헤드리스 Linux 버전을 활용하여, 번들된 llama-server 바이너리를 직접 실행함으로써 CUDA 호환성 및 성능 문제를 우회하는 실용적인 방법을 제시합니다.

llama.cpp의 Multi Token Prediction(MTP) 구현이 BF16을 지원하지 않는 구형 GPU 아키텍처에서 cuBLAS 충돌 문제를 일으킬 수 있어, CUDA 백엔드가 패치되었습니다. 이 패치는 최신 GPU에 영향을 주지 않으면서도 구형 카드에서 MTP가 안정적으로 작동하도록 BF16/FP16/FP32 폴백 로직을 추가했습니다.

작성자는 모델 지원의 불편함에 지쳐 Zig 언어로 자체 LLM 추론 서버를 개발했습니다. 이 서버는 Python이나 Electron 없이 네이티브로 작동하며, MLX 및 GGUF 모델을 실행하고 OpenAI/Anthropic/Ollama API를 지원합니다. 특히 Gemma 4와 Qwen 3.6 등에서 기존 대비 최대 +48% 빠른 성능과 향상된 도구 호출 기능을 제공합니다.