Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
4개의 RTX 3090과 192GB RAM 환경에서 GLM-5.2(744B) 모델을 구동한 성능 테스트 결과입니다. 양자화 비트를 낮추는 것보다 CPU 코어 수를 늘리는 것이 디코딩 속도 향상에 더 효과적임을 확인했습니다.
RTX 3090/4090 환경에서 DiffusionGemma 26B 모델을 vLLM으로 구동한 성능 테스트 결과입니다. 특정 조건에서 매우 높은 토큰 생성 속도를 기록했으나, 정확도 저하와 컨텍스트 유지 능력 부족이라는 한계가 확인되었습니다.
Dual Xeon CPU와 대용량 RAM 환경에서 GLM-5.2 양자화 모델을 로컬로 구동한 실험 사례입니다. ik_llama.cpp를 활용해 NUMA 노드 격리로 성능을 최적화하며, CPU 기반 추론의 실용성을 확인했습니다.
Ollama 대신 llama.cpp를 사용하여 AMD GPU 환경에서 로컬 LLM을 구동하는 초보자용 가이드입니다. Docker Compose를 활용해 llama.cpp 서버와 Open WebUI를 연동하는 설정 방법을 상세히 다룹니다.
에이전트 코딩 로그를 활용해 보정(Calibration)된 Qwopus3.6-27B-Coder의 2-bit GGUF 양자화 모델을 소개합니다. 10GB 미만의 소형 모델임에도 MTP 기술을 통해 SWE-rebench 벤치마크에서 60% 이상의 높은 통과율을 달성했습니다.
LFM2.5 기반의 새로운 다국어 검색 모델인 Embedding-350M과 ColBERT-350M이 공개되었습니다. 두 모델 모두 11개 언어에서 높은 정확도를 제공하며, 기존 RAG 파이프라인에 즉시 적용 가능한 효율적인 추론 속도를 자랑합니다.
North Mini Code가 4-bit 양자화 버전을 출시하여 로컬 하드웨어에서의 실행 편의성을 높였습니다. 또한 Ollama, llama.cpp 기반 런타임 및 OpenRouter API를 지원하여 접근성을 대폭 강화했습니다.
rtk, headroom, caveman 등 LLM 토큰 절감 도구들이 실제 Claude Code 워크로드에서 어느 정도의 비용 절감 효과를 보이는지 분석합니다. 실험 결과, 특정 페이로드에서는 높은 절감률을 보이지만 실제 청구서 기준으로는 프롬프트 캐싱과 워크로드 특성으로 인해 절감 폭이 제한적임을 확인했습니다.
mistral.rs v0.8.10 업데이트를 통해 OpenAI 호환 에이전트 스킬(/v1/skills) 지원이 추가되었습니다. 이제 로컬 오픈 모델에서도 프론티어 API 없이 도메인 지침과 스크립트를 실행할 수 있습니다.
Java MCP SDK를 사용하여 타임존 기반의 날짜와 시간을 제공하는 stateless HTTP MCP 서버를 개발했습니다. 가상 스레드를 활용해 초당 약 35,000개의 쿼리를 처리하며, LLM이 정확한 시간 정보를 가져올 수 있도록 돕습니다.
llama.cpp가 API를 통해 모델의 로드, 언로드 및 다운로드를 지원하는 기능을 추가했습니다. 이를 통해 모델의 전체 라이프사이클을 llama.cpp만으로 관리하고 배포할 수 있는 환경이 마련되었습니다.
Lemonade v10.8 업데이트를 통해 동적 VRAM 관리, 클라우드 오프로드, MCP 게이트웨이 기능이 추가되었습니다. 로컬 모델과 클라우드 API를 유연하게 전환하며 사용할 수 있는 로컬 우선(Local-first) 환경을 제공합니다.
H200 GPU 환경에서 GLM-5.2 모델을 SGLang Docker를 통해 최적화하여 배포하는 방법을 공유합니다. 실험을 통해 262k 컨텍스트와 70t/s의 성능을 달성한 설정값과 주의사항을 다룹니다.
Fable 5가 최적화한 WebGPU 커널을 통해 Gemma 4 E2B 모델을 브라우저 환경에서 초당 255 토큰의 속도로 실행할 수 있게 되었습니다. M4 Max 환경에서의 성능 데모와 함께 관련 커널 및 모델이 공개되었습니다.
Microsoft의 TRELLIS.2 이미지 투 3D 모델을 Apple Silicon에서 네이티브로 실행할 수 있는 MLX 포트를 공개했습니다. M4 Max 환경에서 다양한 해상도를 지원하며 실제 워크플로우 활용에 최적화되었습니다.
오픈 소스 모델을 활용하여 로컬 환경에서 Alexa와 유사한 홈 음성 비서를 구축하기 위한 1년간의 도전과 시행착오를 다룹니다. 무엇이 성공적이었고 무엇이 실패했는지에 대한 실질적인 리뷰를 제공합니다.
LLM 에이전트의 메모리 문제를 단순 저장(Storage)이 아닌 관련성(Relevance)의 관점에서 접근하여 직접 구축한 사례를 다룹니다. HNSW 그래프 재배선, 양자화 오차 보정, 시간적 쇠퇴 모델 도입을 통해 에이전트의 기억력을 개선하는 기술적 방법론을 제시합니다.
LM Studio 대신 llama.cpp를 사용하여 로컬 LLM 에이전트 환경을 구축한 경험을 공유합니다. llama.cpp는 더 빠른 프롬프트 처리 속도와 효율적인 컨텍스트 관리를 제공하여 대규모 컨텍스트 작업에 유리합니다.
RAG 쿼리에 메타데이터를 제공하기 위해 로컬 Qwen 0.6B 모델을 질문 분류용으로 파인튜닝하는 실험 과정을 다룹니다.
Docker Sandbox를 활용하여 로컬 LLM(llama.cpp, MLX)을 호스트 환경으로부터 격리하여 실행하는 두 가지 가이드를 제공합니다. 모델 서버는 호스트 GPU를 사용하되, Pi는 마이크로 VM 내에서 추론 엔드포인트만 노출되도록 설계되었습니다.