llama.cpp b10238 출시: Qwen3-Next MTP 지원 — KataGo, Kimi-K3 GGUF 및 GPU AI 포함
요약
llama.cpp b10238 업데이트를 통해 Qwen3-Next 모델의 MTP 지원이 추가되어 로컬 추론 효율이 향상되었습니다. 또한 KataGo의 실험적 평가 캐시 기능과 Kimi-K3의 GGUF 형식 지원 등 오픈 모델 활용을 위한 다양한 기술적 진전이 이루어졌습니다.
핵심 포인트
- llama.cpp b10238: Qwen3-Next MTP 지원으로 로컬 추론 최적화
- KataGo v1.16.4: 실험적 평가 캐시 도입으로 탐색 및 추론 속도 개선
- Kimi-K3: Unsloth를 통한 소비자 친화적 GGUF 형식 지원
- 다양한 오픈 모델의 로컬 실행 및 하드웨어 호환성 강화
오늘의 요약은 Qwen3-Next MTP 지원을 포함한 llama.cpp b10238의 출시, KataGo v1.16.4의 실험적 평가 캐시(evaluation cache), 그리고 Kimi-K3의 GGUF 형식 가용성을 강조합니다. 또한 NVIDIA의 새로운 AI 인프라 가이드라인과 Nemotron 3 Ultra의 발전을 포함한 AMD의 AI Workbench에 대해서도 자세히 알아봅니다.
로컬 AI 및 오픈 모델 (Local AI & Open Models)
이번 주, llama.cpp는 공식 업데이트를 통해 Qwen3-Next 모델에 대한 MTP 지원을 도입하여 로컬 추론 (inference) 능력을 강화했습니다. 동시에, KataGo는 게임 AI 추론 속도를 직접적으로 향상시키는 실험적 평가 캐시 (evaluation cache)를 출시했으며, Kimi-K3 모델은 Hugging Face의 Unsloth를 통해 소비자 친화적인 GGUF 형식으로 사용할 수 있게 되었습니다.
llama.cpp b10238, Qwen3-Next MTP 지원과 함께 출시 (llama.cpp)
출처: llama.cpp
llama.cpp의 최신 공식 릴리스인 b10238 버전은 Qwen3-Next 모델에 대한 Multi-Tentacle-Perception (MTP) 지원을 추가함으로써 모델 호환성 측면에서 상당한 진전을 이루었습니다. MTP 또는 이와 유사한 아키텍처 설계는 일반적으로 더 효율적이거나 특화된 처리를 위해 설계된 신경망 내의 특정 구조적 요소를 의미합니다. llama.cpp 사용자들에게 이는 로컬 실행에서의 확립된 효율성을 활용하여 CPU 및 GPU를 포함한 광범위한 소비자용 하드웨어에서 Qwen3-Next 모델에 대한 직접적이고 최적화된 추론이 가능함을 의미합니다. 이번 업데이트는 최첨단 LLM을 고사양 서버 인프라 없이도 실행할 수 있도록, 새로운 오픈 웨이트 (open-weight) 모델을 로컬 실행용으로 신속하게 통합하고 최적화하려는 프로젝트의 의지를 강조합니다. b10238 업데이트에는 Python 타입 체크 관련 수정 사항과 num_mtp 레이어 계산을 위한 로직도 포함되어 있어, 통합 과정이 지속적으로 정교화되고 있음을 보여줍니다.
최신 오픈 웨이트 (open-weight) 모델을 로컬에서 실행하는 모든 이들에게 중요한 업데이트입니다.
llama.cpp의 MTP 지원은 다양한 하드웨어에서 Qwen3-Next에 대한 더 나은 호환성과 잠재적으로 더 최적화된 추론 (inference)을 의미합니다.
KataGo v1.16.4, 실험적 평가 캐시 (Evaluation Cache) 도입 (KataGo (囲碁))
출처: KataGo (囲碁)
호평받는 바둑 AI 엔진인 KataGo가 실험적인 평가 캐시 (evaluation-caching) 기능을 도입한 v1.16.4 버전을 출시했습니다. 이 새로운 기능은 기본적으로 활성화되어 있지는 않지만, gtp.cfg 또는 해당 설정 파일에서 useEvalCache=true로 설정하여 활성화할 수 있습니다. 평가 캐시는 엔진의 광범위한 탐색 (search) 과정 중에 마주치는 동일하거나 매우 유사한 게임 상태에 대해 이전에 계산된 신경망 (neural network) 평가 값을 저장하고 재사용함으로써 추론을 가속화하는 것을 목표로 합니다. 이는 바둑 AI의 고유한 '탐색 대 평가 트레이드오프 (search-vs-evaluation trade-offs)' 문제를 직접적으로 해결하여, 잠재적으로 중복 계산을 줄이고 수 선택 (move selection) 속도를 크게 높여줍니다. 소비자용 GPU에서 KataGo를 실행하는 사용자들에게 이 실험적 기능은 더 효율적이고 빠른 분석 또는 게임 플레이를 위한 경로를 제공하며, 더 스마트한 탐색 알고리즘과 최적화된 NNUE 평가 함수를 통해 로컬 게임 AI 성능의 한계를 넓혀줍니다.
이 평가 캐시는 바둑 애호가들에게 상당한 성능 향상을 제공하며, 탐색 중 평가 시간을 직접적으로 단축시켜 소비자용 GPU에서 KataGo를 더욱 빠르게 만들어 줍니다.
Kimi-K3 모델, Unsloth를 통해 GGUF 형식으로 사용 가능 (Hugging Face 트렌딩)
Hugging Face에서 주목할 만한 트렌드 아이템은 unsloth에 의해 특별히 최적화된 moonshotai/Kimi-K3 모델이 GGUF 형식으로 제공된다는 점입니다. GGUF는 소비자급 하드웨어에서 대규모 언어 모델 (LLM)을 실행하기 위해 설계된 매우 효율적인 양자화 (Quantized) 파일 형식으로, CPU 및 GPU를 통한 로컬 추론 (Local Inference)에서 고급 모델을 사용할 수 있게 해줍니다. unsloth의 기여는 표준 GGUF 변환에 비해 일반적으로 더 빠른 추론 속도와 더 낮은 메모리 소비를 제공하는 최적화된 양자화 (Quantizations)를 제공함으로써 이를 더욱 강화합니다. Kimi-K3 모델은 "이미지-텍스트-투-텍스트 (image-text-to-text)" 모델로, 이는 멀티모달 (Multimodal) 능력을 의미합니다. 이번 출시는 Kimi-K3의 기능을 로컬에서 활용하고자 하는 개발자와 애호가들에게 매우 중요하며, 클라우드 기반 리소스 없이도 복잡한 모델을 배포할 수 있는 실질적인 솔루션을 제공합니다. 이는 "소비자용 GPU에서 실행 가능한 모든 것" 및 "양자화 및 압축 (Quantization & Compression)"이라는 초점과 완벽하게 일치합니다.
Unsloth를 통해 Kimi-K3와 같은 최첨단 모델이 GGUF 형식으로 빠르게 출시되는 것을 보면 로컬 추론 최적화의 빠른 속도를 확인할 수 있으며, 소비자용 GPU 사용자들의 접근성을 넓혀줍니다.
Full Local AI & Open Models archive
GPU, CUDA 및 자율 주행
이번 주는 AI 개발 및 GPU 성능 분야의 중요한 진전이 특징입니다. AMD는 ROCm에서 간소화된 맞춤형 모델 배포를 위한 AI Workbench를 도입했으며, NVIDIA는 H100, GB200, GB300 시스템에서 최고 성능을 끌어내는 방법에 대한 통찰력을 제공하고 고급 칩 설계를 위한 Nemotron 3 Ultra를 출시했습니다.
NVIDIA Exemplar Cloud: AI 인프라에서 전체 성능을 끌어내기 위한 교훈 (NVIDIA Developer Blog)
NVIDIA Developer Blog의 이 기사는 NVIDIA의 하이엔드 AI 인프라, 특히 H100, GB200 NVL72 및 GB300 NVL72 시스템에서의 성능 최적화에 대한 중요한 통찰력을 제공합니다. 이 글은 동일한 하드웨어 구성이라도 훈련 처리량(training throughput)이 크게 달라질 수 있음을 강조하며, 적절한 시스템 설정 및 최적화의 중요성을 역설합니다. 이 기사는 NVIDIA의 Exemplar Cloud에서 얻은 교훈을 개괄하며, AI 모델이 잠재력을 최대한 발휘할 수 있도록 인프라 설계, 소프트웨어 스택(software stack) 구성 및 워크로드 스케줄링(workload scheduling)에 대한 모범 사례를 상세히 설명합니다.
다루는 주요 영역에는 네트워크 토폴로지(networking topology), 메모리 관리(memory management), 그리고 대규모 AI 배포 시 흔히 발생하는 성능 병목 현상(performance bottlenecks)을 식별하고 해결하는 방법이 포함됩니다. 이 가이드는 상당한 규모의 AI 클러스터를 배포하거나 관리하는 조직에 특히 가치가 있으며, 강력한 NVIDIA GPU로부터 투자 수익(ROI)을 극대화할 수 있는 실행 가능한 조언을 제공합니다. 또한 병렬 처리(parallel processing), 효율적인 데이터 전송(data transfer), 커널 실행(kernel launch) 최적화의 미묘한 차이를 깊이 있게 다루며, 이들은 모두 최고 수준의 훈련 및 추론 속도를 달성하는 데 필수적입니다. 이러한 교훈을 이해하면 개발자와 시스템 관리자가 GPU 유휴 시간(idle time)을 줄이고 복잡한 AI 모델의 개발 주기를 가속화하는 데 도움이 되어, 최첨단 하드웨어를 더욱 효율적으로 사용하는 결과로 직접 이어질 수 있습니다.
이 글은 H100, GB200 또는 GB300 시스템을 배포하는 모든 이들이 반드시 읽어야 할 필독서입니다. 성능 함정을 피하고 처리량을 진정으로 극대화하기 위한 구체적이고 값진 교훈을 제공하기 때문입니다.
AMD AI Workbench에서 커스텀 모델 온보딩 및 배포하기 (AMD ROCm Blog)
출처: AMD ROCm Blog
AMD ROCm 블로그는 AMD AI Workbench에 대한 중요한 업데이트를 발표하며, 커스텀 AI 모델을 온보딩(onboard)하고 배포하는 방법에 대한 상세한 가이드를 제공합니다. 기존의 AIM 카탈로그(AIM Catalog)가 AMD 하드웨어에 즉시 배포 가능한 엄선된 모델들을 제공했다면, 이번 새로운 기능은 개발자들이 Hugging Face Hub와 같은 외부 소스나 심지어 독점적인 커스텀 학습 모델(proprietary custom-trained models)을 활용할 수 있도록 지원합니다. 이는 AMD AI Workbench의 유연성과 유용성을 크게 확장하여, AMD GPU 기반 AI 개발을 위한 더욱 포괄적인 플랫폼으로 만들어 줍니다. 이 기사는 사용자가 이러한 외부 모델을 통합하는 과정을 안내하며, ROCm 생태계 내에서 호환성과 최적의 성능을 보장하기 위한 필수 구성 및 모범 사례(best practices)를 다룹니다.
이번 업데이트는 AI 개발의 흔한 과제인 '표준 카탈로그에 포함되지 않은 고유하거나 특화된 모델을 적응시키고 배포해야 하는 필요성'을 해결해주기 때문에 실무자들에게 매우 중요합니다. 커스텀 모델의 통합을 단순화함으로써, AMD는 자신의 특정 AI 애플리케이션을 위해 AMD Instinct GPU와 ROCm 소프트웨어 스택의 강력한 성능을 활용하고자 하는 개발자들의 진입 장벽을 낮춥니다. 이는 실용성을 강조하여 사용자가 다양한 연구 및 생산 요구 사항에 맞춰 워크벤치의 기능을 확장할 수 있게 하며, 이를 통해 AMD AI 하드웨어 커뮤니티 내에서 더 넓은 채택과 혁신을 촉진합니다.
Hugging Face의 모델이나 커스텀 학습된 변형 모델을 AMD AI Workbench에 쉽게 통합할 수 있게 된 것은 ROCm 개발자들에게 게임 체인저(game-changer)이며, 마침내 실제 프로젝트에 필요한 유연성을 제공합니다.
NVIDIA Nemotron 3 Ultra, 에이전트 기반 RTL 코딩의 정확도 및 효율성 측면에서 오픈 모델 선도 (NVIDIA Developer Blog)
NVIDIA의 개발자 블로그(Developer Blog)는 에이전트 기반의 레지스터 전송 레벨 (RTL) 코딩에서 정확도와 효율성 측면에서 선도적인 성능을 보여주고 있는 오픈 모델인 Nemotron 3 Ultra를 강조합니다. 이러한 발전은 RTL 개발 및 검증이 엔지니어링 시간의 제약을 점점 더 많이 받고 전문적인 하드웨어와 소프트웨어를 필요로 하는 현대 칩 설계 분야에서 특히 중요합니다. Nemotron 3 Ultra의 역량은 복잡한 CPU, GPU 및 기타 AI 시스템을 설계하는 데 있어 기초적인 단계인 RTL 코드의 더욱 자동화되고 효율적인 생성 및 검증을 가능하게 합니다. 이 기사는 Nemotron 3 Ultra를 반도체 설계 프로세스를 가속화하고, 인적 오류를 줄이며, 궁극적으로 차세대 하드웨어의 시장 출시 기간(time-to-market)을 단축하는 데 중요한 도구로 자리매김합니다.
"에이전트 기반 RTL 코딩 (agentic RTL coding)"에 대한 집중은 대규모 언어 모델 (LLM)을 활용하여 엔지니어를 지원하는, 더욱 자율적이고 지능적인 설계 워크플로우로의 이동을 강조합니다. 이 분야에서 뛰어난 성능을 발휘하는 오픈 모델을 제공함으로써, NVIDIA는 AI 애플리케이션의 경계를 넓힐 뿐만 아니라 하드웨어 개발 자체의 진화에도 직접적으로 기여하고 있습니다. 이는 GPU 및 AI 하드웨어 혁신의 속도에 직접적인 영향을 미치는데, 더 효율적인 설계 사이클이 더 빠른 반복(iteration)과 더 정교한 아키텍처로 이어질 수 있기 때문입니다. 정확도와 효율성에 대한 강조는 Nemotron 3 Ultra를 하드웨어 개발 파이프라인을 최적화하려는 칩 설계자와 연구자들에게 가치 있는 자산으로 만듭니다.
에이전트 기반 RTL 코딩에서 Nemotron 3 Ultra가 보여주는 성능은 자동화된 칩 설계의 미래를 알리는 강력한 신호이며, NVIDIA(및 기타 기업들)가 미래의 GPU를 개발하는 방식에 직접적인 영향을 미칩니다.
Full GPU, CUDA & Autonomous Driving archive
공식 릴리스 피드, 벤더 변경 로그 및 엔지니어링 블로그에서 매일 수집되었습니다. 아카이브: https://media.patentllm.org
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기