Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
llama-server에 커스텀 샘플링 로직을 직접 추가할 수 있는 확장 기능 아이디어와 프로토타입을 소개합니다. 이를 통해 사용자는 전체 코드를 포크하거나 래퍼를 만들지 않고도 루프 감지, 단계별 샘플링 파라미터 변경, 개인정보 삭제 등 실험적인 샘플링 기능을 구현할 수 있습니다.
llama.cpp 메인라인에 MTP(Multi-Token Prediction) 기반의 투기적 디코딩 기능이 도입되었습니다. 벤치마크 결과, Strix Halo와 RTX 3090 시스템에서 Qwen3.6 27B 모델을 사용할 때 최대 2.44배의 성능 향상을 기록했습니다.
Colby McHenry가 개발한 'Codegraph'는 사전 인덱싱된 지식 그래프를 활용하여 AI 에이전트의 코드베이스 탐색 효율을 극대화하는 도구입니다. 심볼 관계와 호출 그래프를 사용하여 파일을 직접 스캔하는 대신 그래프를 쿼리함으로써, API 도구 호출 횟수를 최대 94% 줄이고 처리 속도를 대폭 향상시켰습니다.
RTX 3090 환경에서 Qwen 3.6 27B 모델을 대상으로 KV 캐시 양자화 성능을 PPL과 KLD 지표로 분석한 벤치마크 결과입니다. 분석 결과, PPL은 양자화 손실을 과소평가하는 경향이 있어 도구 호출이나 JSON 구조 유지에 중요한 99.9% KLD 지표를 확인하는 것이 필수적임을 강조합니다.
기존의 text-to-3D 방식이 단순한 메쉬 덩어리를 생성하는 한계를 극복하기 위해, LLM을 구조화된 코드 컴파일러로 활용하여 기능적 부품과 관절을 가진 3D 객체를 생성하는 도구인 Nova3D를 소개합니다. 이 파이프라인은 Blender Python 코드를 생성하여 씬 그래프를 직접 조작함으로써, 변환 노드와 피벗 축이 보존된 정교한 다중 부품 GLB 파일을 출력합니다.
4개의 Nvidia RTX A4000(각 16GB) 환경에서 Llama.cpp와 MTP를 활용하여 Qwen 3.6 27B Q8 모델을 구동한 실험 결과입니다. MTP 활성화 시 추론 시 약 45 t/s, 코딩 시 60 t/s 이상의 성능을 보여주며, MoE 모델의 경우 레이어 분할 모드를 통해 높은 토큰 생성 속도를 달성할 수 있음을 확인했습니다.
LLaMA.cpp와 TurboQuant 환경에서 Qwen 모델을 위한 Multi-Token Prediction(MTP) 기술을 구현하여 추론 성능을 대폭 향상시켰습니다. MacBook Pro M5 Max 환경에서 테스트한 결과, 초당 토큰 생성 속도가 21 tokens/s에서 34 tokens/s로 약 40% 증가하였으며 90%의 높은 수락률을 기록했습니다.
Lemonade v10.5.1 업데이트를 통해 Strix Halo를 위한 MTP 및 ROCm 7.13 지원이 추가되었습니다. 이번 릴리스에는 Qwen3.6-27B-MTP-GGUF 모델 가져오기 기능과 Fedora 43 지원 관련 수정 사항이 포함되어 있습니다.
OpenMOSS TTS 모델을 위한 GGML 기반의 순수 C++ 파이프라인을 공개합니다. 복잡한 Python 생태계 설정 없이도 사용할 수 있도록 서버 모드와 단일 실행 CLI 모드를 모두 지원하여 사용 편의성을 높였습니다.
조직 규모의 에이전트 운영을 위해 설계된 단순화된 멀티 에이전트 아키텍처를 소개합니다. LangGraph, CrewAI, Harbor를 활용하여 목표 설정, 작업 조정, 보안 및 추적 문제를 해결하며, 링 기반 프로토콜을 통해 에이전트의 계층적 역할과 메시지 라우팅을 관리합니다.
Qwen 3.6 27b F16 모델을 활용하여 Pacman 게임 클론을 제작하는 벤치마크를 통해 로컬 코딩 에이전트의 실용성을 검증했습니다. 실험 결과, 16bit와 8bit 양자화 사이에는 성능 차이가 매우 크며, 적절한 채팅 템플릿과 MTP 투기적 디코딩 기술이 에이전트 성능 및 속도에 결정적인 영향을 미침을 확인했습니다.
RTX 5060 Ti를 활용한 로컬 LLM 추론을 위한 club-5060ti 저장소가 구조화된 벤치마크 및 레시피 허브로 업데이트되었습니다. 이 프로젝트는 단일 및 듀얼 GPU 설정, 혼합 GPU 구성에 대한 상세한 성능 데이터와 llama.cpp/vLLM 활용 가이드를 제공합니다.
VRAM이 제한된 로컬 환경에서 서브 에이전트(sub-agents)를 효율적으로 활용하기 위한 구현 방안을 소개합니다. llama.cpp와 pi 코딩 에이전트를 활용하여 단일 KV 캐시 슬롯 제약을 극복하고, 컨텍스트를 관리하며 서브 에이전트 작업을 수행하는 방법을 다룹니다.
cyankiwi AWQ 26.05 업데이트는 기존 AWQ 방식의 한계를 극복하기 위해 채널별 스케일과 양자화 범위를 재구성 목적 함수를 바탕으로 공동 최적화(jointly fits)합니다. Llama-3 시리즈를 대상으로 한 벤치마크 결과, 모든 모델에서 BF16 베이스라인 대비 가장 낮은 KL 발산(KLD)을 기록하며 우수한 품질을 입증했습니다.
CPU 환경에서 Kokoro 82M과 Supertonic 3 TTS 모델의 성능 및 품질을 직접 벤치마크한 결과입니다. Supertonic 3는 속도와 품질 사이의 조절이 가능하여 낮은 지연 시간이 필요한 서비스에 적합하며, Kokoro 82M은 속도는 상대적으로 느리지만 매우 자연스러운 음성 품질을 제공합니다.
RTX 3090 환경에서 Qwen2.5-27B-MTP 모델을 사용하여 llama.cpp의 MTP(Multi-Token Prediction) 성능을 테스트한 결과입니다. MTP 사용 시 프롬프트 처리(PP) 속도는 다소 감소하지만, 텍스트 생성(TG) 속도가 85% 향상되어 전체 작업 시간을 약 41% 단축하는 효과를 확인했습니다.
Hexllama는 llama.cpp를 효율적으로 관리할 수 있도록 돕는 데스크톱 GUI 도구이자 템플릿 매니저입니다. 복잡한 CLI 명령어 설정, 모델 버전 관리, HuggingFace 모델 다운로드 과정을 시각적인 인터페이스를 통해 간소화하여 로컬 LLM 환경을 최적화합니다.
Qualcomm의 Snapdragon X2 칩셋을 탑재한 노트북에서 VecML의 AI 데이터베이스를 활용하여 20만 개의 문서를 기반으로 한 RAG 시스템을 구현한 사례를 소개합니다. 이 시스템은 강력한 NPU 성능을 활용하여 RTX 5060 노트북 대비 약 50% 수준의 임베딩/인덱싱 속도를 보여주며, 저메모리 및 저토큰 설계로 온디바이스 환경에 최적화되어 있습니다.
작성자가 개발한 OpenCodeOrchestra 하네스를 사용하여 단일 파일 HTML Canvas 애니메이션 구현 능력을 바탕으로 다양한 오픈 소스 모델과 프론티어 모델의 성능을 비교했습니다. 모든 모델에 동일한 프롬프트를 제공하여 시차 효과, 회전하는 바퀴, 조명 등이 포함된 사실적인 자동차 주행 장면을 생성하도록 요청하였으며, 그 결과를 시각적 갤러리로 공개했습니다.
작성자는 대규모 엔터프라이즈 소프트웨어 개발 과정에서 Cursor를 대체할 도구로 Qwen3.6:35b-a3b 모델을 사용한 경험을 공유합니다. Kimi 2.6 및 DeepSeek 모델과 비교했을 때, 이 모델은 높은 업무 이해도와 이미지 입력 지원 능력을 갖추었으면서도 OpenRouter를 통한 비용 효율성이 매우 뛰어납니다.