Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 글은 colibrì 엔진을 사용하여 GPU 없이도 대규모 MoE 모델인 GLM-5.2 (744B)를 로컬 단일 컴퓨터에서 구동하는 실습 과정을 다룹니다. 핵심 원리는 필요한 전문가(expert)만 디스크에서 RAM으로 스트리밍하여 메모리 부담을 줄이는 것입니다. 이 엔진은 사용 시간이 길어질수록 성능이 향상되는 특징을 보여줍니다.
CUDA GPU 환경에서 llama.cpp를 직접 설정하고 사용하는 과정에서 발생하는 복잡한 오류 문제를 다루고 있습니다. 이 글은 LM Studio의 헤드리스 Linux 버전을 활용하여, 번들된 llama-server 바이너리를 직접 실행함으로써 CUDA 호환성 및 성능 문제를 우회하는 실용적인 방법을 제시합니다.

llama.cpp의 Multi Token Prediction(MTP) 구현이 BF16을 지원하지 않는 구형 GPU 아키텍처에서 cuBLAS 충돌 문제를 일으킬 수 있어, CUDA 백엔드가 패치되었습니다. 이 패치는 최신 GPU에 영향을 주지 않으면서도 구형 카드에서 MTP가 안정적으로 작동하도록 BF16/FP16/FP32 폴백 로직을 추가했습니다.

작성자는 모델 지원의 불편함에 지쳐 Zig 언어로 자체 LLM 추론 서버를 개발했습니다. 이 서버는 Python이나 Electron 없이 네이티브로 작동하며, MLX 및 GGUF 모델을 실행하고 OpenAI/Anthropic/Ollama API를 지원합니다. 특히 Gemma 4와 Qwen 3.6 등에서 기존 대비 최대 +48% 빠른 성능과 향상된 도구 호출 기능을 제공합니다.

Qwen3 235B A22B Instruct 2507을 기반으로 메모리 파이프라인을 구축하여, 기존 시스템 대비 높은 성능과 효율성을 입증했습니다. 특히 LongMemEval-S에서 최고 점수를 기록하며 신뢰성 있는 비서(assistant) 구현에 성공했음을 공유합니다.

거대 기술 기업들이 인터넷 스크래핑을 통해 독점적인 최첨단 모델을 구축하고 높은 가격으로 제한하는 현상을 지적합니다. 이에 맞서 오픈 소스 커뮤니티가 '모델 증류' 기법을 활용하여 저렴한 대안을 만들고 있으며, 이는 빅테크의 규제 시도와 충돌하고 있습니다.
LokalBot Mac 앱이 대규모 업데이트를 거쳐 로컬 에이전트 모드(Agent Mode)와 미팅 접근(MCP) 기능을 추가했습니다. 온디바이스 LLM의 메모리 관리 효율성을 개선하고, 시스템 전체 받아쓰기 및 TTS 기능 등 사용자 경험을 크게 향상시켰습니다.
LLaMa.cpp를 활용하여 Qemu 환경에서 실행되는 LVGL 기반 HMI의 성능 프로파일링 과정을 보여주는 데모입니다. 이를 통해 로컬 AI 기술을 이용해 리눅스 프로그램의 자동화된 성능 분석 및 디버깅 방법을 제시합니다.

본 글은 Morris Elementary Effects와 Taguchi 방법을 활용하여 llama.cpp의 파라미터를 자동으로 최적화하는 방법을 소개합니다. 이 기법들은 복잡한 설정 조합을 스캔하여 로컬 모델에 가장 적합한 파라미터 세트를 찾는 데 도움을 주며, 효율적인 파라미터 탐색(parameter sweeps)을 가능하게 합니다.

LLM의 출력은 배치 크기나 추론 스택의 특성상 불안정할 수 있습니다. 본 글에서는 LLM 출력을 테스트하는 방법을 제시하며, 반복 실행을 통해 통과율(pass rate)을 측정하고 Pydantic 같은 구조화 출력 기능을 활용하여 평가의 신뢰도를 높이는 방법을 다룹니다.
본 프로젝트는 에이전트가 사용자에게 말하거나(호출) 상호작용하는 양방향 대화 시스템을 제공합니다. 기존의 일방적인 TTS나 받아쓰기 방식의 한계를 극복하며, 여러 프로필과 개성을 가진 에이전트를 구현할 수 있습니다.

Qwen3.6-35B-A3B-MTP 모델을 Pi Coding Agent로 사용하여 노트북 환경에서 웹사이트 구축 과정을 테스트했습니다. 별도의 스킬 없이 단일 프롬프트와 세 번의 시도 끝에 성공적으로 프로젝트를 완성했으며, 다른 최첨단 모델과 비교해도 준수한 성능을 보여주었습니다.
Colibri를 Hy3와 연동하여 낮은 사양의 하드웨어에서도 구동할 수 있도록 포팅하는 방법을 공유합니다. 기존에는 25GB VRAM이 필요했지만, 이제는 10GB 이하의 메모리만으로도 실행 가능해져 접근성이 크게 향상되었습니다.

Godot 엔진과 GDScript, Vulkan compute shaders만을 활용하여 Gemma 4와 같은 LLM을 로컬에서 구동하는 실험적인 프로젝트가 소개되었습니다. 이 시스템은 GGUF 파일을 로드하고, 토큰화, 샘플링, KV 캐시 관리 등 핵심 기능을 Godot 내부에서 처리합니다.
llama.cpp의 b9978 버전은 에이전트 워크로드에서 발생하던 주요 체크포인트 버그를 수정했습니다. 기존에는 모든 에이전트 턴마다 새로운 체크포인트를 생성하여 컨텍스트 창을 불필요하게 축소시키고 재처리를 강제하는 문제가 있었습니다. 이번 업데이트로 근접한 체크포인트 제거 문제를 해결하여, 넓고 긴 컨텍스트 창 유지와 에이전트 세션 속도 향상을 가져왔습니다.
Kreuzberg 프로젝트가 이름 변경을 거쳐 Xberg로 새롭게 출시됩니다. 발음 및 이해 용이성을 높이기 위해 이름을 간소화한 것이 주된 이유입니다. 개발팀은 기존 리포지토리의 복잡성 때문에, 안정적인 LTS 버전은 별도의 GitHub 리포지토리에 배포하기로 결정했습니다.

개발자가 개인적으로 만든 '검열되지 않은 AI' 프로젝트를 무료로 공개했습니다. 이 시스템은 특수한 내부 모델 토큰을 시스템 프롬프트에 주입하여 모델을 일종의 해리 상태(dissociative state)로 만들어 검열 없이 자유롭게 답변하도록 설계되었습니다.
llama.cpp의 B9966 수정 사항은 프로덕션 환경에서 `-sm tensor`를 사용할 때 디코드 스레드의 성능을 개선합니다. 이 변경은 매 토큰마다 반복되던 정규표현식 재컴파일 과정을 제거하여 CPU 자원 낭비를 크게 줄여줍니다.

Stable Diffusion용 로컬 데스크톱 UI인 Flaxeo Image가 출시되었습니다. 이 도구는 sd.cpp 릴리스를 기반으로 하며, 이미지 생성, 편집, 비디오 경로, 모델 관리 등 백엔드가 제공하는 주요 기능을 사용자 인터페이스로 노출합니다.

이 글은 llama.cpp와 vLLM 등 로컬 LLM 서빙 환경의 상태를 모니터링할 수 있는 오픈 소스 대시보드 제작 과정을 소개합니다. 이 단일 파일 대시보드는 GPU 활용률, 모델별 처리량(throughput), 시스템 통계 등을 녹색 터미널 스타일로 한눈에 보여줍니다.