Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
GitHub Copilot 구독 방식 대신 Qwen 3.6 35B 모델을 활용하여 직접 구축한 로컬 코드 에이전트 사례를 소개합니다. SSD 오프로드 기술을 통해 24GB Mac Pro 환경에서도 원활하게 작동함을 확인했습니다.
GGML_CUDA_ALLREDUCE 설정을 제거함으로써 MTP(Multi-Token Prediction) 환경에서 TPS(Tokens Per Second) 성능이 크게 향상됨을 확인했습니다. 특정 환경에서 성능 저하를 일으키던 설정을 조정하여 최적화에 성공한 사례를 공유합니다.
여러 AI 도구에서 반복되는 MCP 서버 설정 문제를 해결하기 위해 로컬 우선 방식의 게이트웨이인 'Conduit'을 개발했습니다. 모든 MCP 서버를 중앙에서 관리하며, 모델의 컨텍스트를 절약하기 위해 필요한 도구만 검색하여 사용하는 메타 도구 방식을 채택했습니다.
llama.cpp를 활용하여 로컬 LLM의 추론 성능을 최적화하는 실용적인 가이드를 제공합니다. VRAM 관리, KV 캐시, MoE 배치 및 CPU 튜닝 등 성능 향상을 위한 핵심 기술을 다룹니다.
멀티 소켓 CPU 시스템에서 LLM 추론 성능을 극대화하기 위해 ik_llama.cpp에 '--numa mirror' 모드를 추가했습니다. 이 모드는 모델 가중치와 KV 캐시를 각 소켓에 복제하여 원격 메모리 접근으로 인한 성능 저하를 방지합니다.
Qwen Coder를 코딩 보조 프로세서(sidecar)로 활용하기 위한 실험 결과입니다. 기존의 과도한 제약 사항을 수정하여 직접적인 코드 생성이 가능하도록 설정을 변경하며 A/B 테스트를 진행했습니다.
2개의 Radeon R9700 GPU를 사용하여 llama.cpp 환경에서 Qwen 3.6 27B 모델을 구동한 멀티 GPU 설정 및 성능 테스트 결과입니다. ROCm 환경에서의 토큰 생성 속도, 프리필 처리량, MTP 초안 수락률 및 프롬프트 캐시 효율성을 상세히 분석합니다.
다양한 AI 에이전트 설정 파일(AGENTS.md, .cursorrules 등)의 컨벤션을 정리한 가이드를 소개합니다. 각 파일의 실제 채택 정도를 adopted, emerging, proposed 태그로 구분하여 실질적인 표준을 파악할 수 있도록 돕습니다.
Rust 기반의 로컬 우선 시맨틱 메모리 시스템인 semantic-memory가 출시되었습니다. SQLite를 활용한 하이브리드 검색과 타입 지정 그래프 에지를 통해 AI 에이전트 및 RAG 애플리케이션에 지속적인 메모리를 제공합니다.
여러 코딩 에이전트를 동시에 사용할 때 발생하는 워크스페이스 혼선 문제를 해결하기 위한 에이전트 오케스트레이션 아키텍처를 제안합니다. 코드, 결과물(artifacts), 비밀 정보(secrets)를 각각 독립된 디렉토리로 분리하여 보안과 관리 효율성을 높이는 구조를 다룹니다.
AMD Radeon 7900XTX GPU를 활용하여 Qwen 3.6 27B 모델을 131k 컨텍스트로 구동하는 최적화 방법을 소개합니다. iGPU를 통한 VRAM 확보와 KV 캐시 양자화 기술을 통해 성능과 메모리 효율을 극대화하는 가이드를 제공합니다.
Dual RTX 3090 환경에서 vLLM Prefix Caching과 OpenCode 병렬 에이전트를 활용해 개발 속도를 2.4배 향상시킨 최적화 사례를 다룹니다. 대규모 컨텍스트 사용 시 발생하는 KV 캐시 부족 문제를 비대칭 컨텍스트 프로필로 해결하는 기술적 방법을 제시합니다.
유료 API 없이 로컬 에이전트에 웹 접속 기능을 부여하기 위해 SearXNG와 Scrapling을 결합한 구현 방법을 소개합니다. SearXNG로 검색을 수행하고 Scrapling과 Trafilatura를 통해 웹 페이지를 마크다운 형식으로 추출하는 워크플로우를 다룹니다.
M&A 합병 계약서에서 복잡한 데이터를 JSON 형식으로 추출하는 MAUD 데이터셋과 그 성능 평가에 관한 글입니다. 단순한 스키마 강제를 넘어 데이터의 의미론적 정확도와 환각률을 측정하는 실험적 접근을 다룹니다.
중고 GPU 4개를 P2P로 연결하여 약 1,800달러의 저렴한 비용으로 Qwen/Qwen3.6-27b-FP8 모델을 구동하는 방법을 소개합니다. vLLM을 활용해 262K의 긴 컨텍스트와 BF16 KV 캐시를 적용한 추론 최적화 설정 및 벤치마크 결과를 공유합니다.
Qwen 모델을 위한 Eagle(3) 투기적 디코딩(Speculative Decoding) 기능이 새롭게 출시되었습니다. 사용자는 드래프트 모델을 지정하여 초당 토큰 수(TPS)를 향상시킬 수 있으나, 현재 텐서 병렬화 미지원 및 VRAM 점유 등의 제약 사항이 존재합니다.
단 하나의 JSON 설정으로 LLM의 사전 학습(Pretrain)부터 SFT, 평가까지 엔드 투 엔드로 처리할 수 있는 오픈 소스 프레임워크 'librarian-press'를 소개합니다. 스팟 인스턴스 환경에서도 중단된 샤드부터 재개할 수 있는 안정적인 파이프라인을 제공합니다.
GLM-5.2 모델을 llama.cpp 및 Unsloth Studio를 통해 로컬 환경에서 실행할 수 있게 되었습니다. 2-bit 양자화를 통해 모델 크기를 대폭 줄이면서도 높은 정확도를 유지하며, 고사양 Mac 환경에서 구동이 가능합니다.
에이전트가 스스로의 자기 성찰(self-reflection) 인프라를 재구축하여 기존의 오류를 해결한 사례를 소개합니다. 에이전트가 스스로 필요한 시스템 프롬프트와 전략을 설계함으로써 셸 명령 오류와 공격적인 도구 사용 문제를 자가 교정했습니다.
4개의 RTX 3090과 192GB RAM 환경에서 GLM-5.2(744B) 모델을 구동한 성능 테스트 결과입니다. 양자화 비트를 낮추는 것보다 CPU 코어 수를 늘리는 것이 디코딩 속도 향상에 더 효과적임을 확인했습니다.