vLLM v0.26.0 CUDA Graphs 개선 — llama.cpp, Stockfish 16.1, & AMD GPU Operator 포함
요약
vLLM v0.26.0의 CUDA Graphs 개선과 Inkling 모델 지원, llama.cpp의 GLM-5.2 추측적 디코딩 추가 등 로컬 및 서버급 추론 엔진의 주요 업데이트를 다룹니다. 또한 AMD GPU Operator v1.5.0 출시와 NVIDIA TensorRT 개발자 도구 소식도 포함되어 있습니다.
핵심 포인트
- vLLM v0.26.0: Inkling 모델 지원 및 CUDA Graphs 개선을 통한 성능 향상
- llama.cpp: GLM-5.2 모델에 대한 추측적 디코딩(Speculative Decoding) 지원
- AMD: Kubernetes 인프라 제어를 위한 GPU Operator v1.5.0 출시
- Stockfish 16.1 및 새로운 NVIDIA TensorRT 개발자 도구 출시
오늘의 엔지니어링 다이제스트는 vLLM v0.26.0의 CUDA graph 개선 및 Inkling 지원을 포함하여 AI 및 GPU 발전 소식으로 가득 차 있으며, llama.cpp의 GLM-5.2 추측적 디코딩 (speculative decoding) 추가 소식도 있습니다. 이와 함께, AMD는 Kubernetes 인프라 제어 및 자동 노드 복구 기능을 갖춘 GPU Operator v1.5.0을 출시했으며, Stockfish 16.1 및 새로운 NVIDIA TensorRT 개발자 도구도 출시되었습니다.
로컬 AI 및 오픈 모델 (Local AI & Open Models)
이번 주의 주요 하이라이트는 로컬 추론 엔진의 중요한 업데이트를 다룹니다: llama.cpp는 GLM-5.2를 위한 추측적 디코딩 (speculative decoding)을 추가하였고, vLLM은 Inkling 모델 지원과 조각별 CUDA graphs (piecewise CUDA graphs)를 통한 성능 향상을 도입했습니다. 또한, 유명한 Stockfish 16.1 체스 엔진의 최신 공식 버전이 출시되어 게임 AI의 지속적인 발전을 강조하고 있습니다.
llama.cpp b10174, GLM-5.2 추측적 디코딩 (speculative decoding) 지원 추가 (llama.cpp)
출처: llama.cpp
대규모 언어 모델을 위한 매우 인기 있는 C/C++ 추론 엔진인 llama.cpp가 버전 b10174를 출시하여 추론 가속화 측면에서 주목할 만한 향상을 가져왔습니다. 이번 업데이트는 특히 GLM_DSA (GLM-5.2) 모델에 대한 NextN/MTP 추측적 디코딩 (speculative decoding) 지원을 도입합니다. 추측적 디코딩 (speculative decoding)은 더 작고 빠른 초안 모델 (draft model)이 여러 토큰을 미리 예측하게 하고, 이를 더 큰 타겟 모델이 병렬로 검증함으로써 토큰 생성 속도를 크게 높이는 최첨단 기술입니다. 예측이 정확하면 여러 토큰이 동시에 수락되어 유효 추론 속도가 극적으로 증가합니다.
이번 릴리스는 llama.cpp가 지원하는 모델 범위를 확장하여—그 강력한 라인업에 GLM-5.2를 추가하며—소비자급 하드웨어에서 모델을 실행하는 사용자들에게 고급 추론 기술을 대중화합니다. 새로운 모델 유형에 대해 투기적 디코딩 (Speculative Decoding)을 활용할 수 있다는 것은 개발자와 애호가들이 최상급 데이터 센터 GPU를 요구하지 않고도 더 빠르고 효율적인 로컬 AI 추론을 경험할 수 있음을 의미합니다. 사용자들은 GLM-5.2 모델과 함께 --spec-type draft-mtp를 지정함으로써 이 기능을 활용할 수 있으며, 이를 통해 고성능 로컬 AI를 일상적인 사용에 더 접근하기 쉽고 실용적으로 만들 수 있습니다.
llama.cpp에 GLM-5.2를 위한 투기적 디코딩 (Speculative Decoding)을 통합한 것은 로컬 추론 측면에서 큰 승리입니다. 이는 내 GPU에서 이 모델의 응답 속도가 빨라짐을 의미하며, 로컬 LLM 애플리케이션의 사용자 경험을 직접적으로 개선합니다.
vLLM v0.26.0 Inkling 모델 제품군 지원 추가, 성능 향상을 위한 CUDA Graph 개선 (vLLM)
출처: vLLM
고처리량(High-throughput) 및 저지연(Low-latency) LLM 서빙 엔진인 vLLM이 모델 호환성과 추론 성능을 위한 상당한 개선 사항을 담은 v0.26.0 릴리스를 출시했습니다. 주요 하이라이트는 새로운 Inkling 모델 제품군에 대한 완전한 지원으로, 사용자가 vLLM의 최적화된 아키텍처를 통해 이러한 모델들을 효율적으로 배포하고 서빙할 수 있게 합니다. 이는 효율적인 KV 캐시 관리를 위한 PagedAttention과 같은 vLLM의 고급 기능으로부터 혜택을 받을 수 있는 오픈 웨이트 (Open-weight) 모델 생태계를 확장합니다.
또한, vLLM v0.26.0은 조각별 CUDA 그래프 (piecewise CUDA graph) 지원을 도입합니다. CUDA 그래프는 GPU 명령 시퀀스를 캡처하고 재실행함으로써 GPU 연산의 오버헤드를 줄이는 데 매우 중요하며, 특히 작은 배치 크기나 동적 워크로드 (dynamic workloads)에서 추론 속도를 크게 향상시킵니다. 이러한 조각별 구현은 단일 구조의 (monolithic) CUDA 그래프에 비해 더 높은 유연성과 폭넓은 적용 가능성을 제공할 것으로 보입니다. 양자화된 모델 (quantized model) 지원과 전반적인 효율성을 높이기 위해 v0.25.0에서 밀집 모델 (dense models)의 기본값으로 Model Runner V2가 채택되었던 이전 릴리스를 바탕으로, v0.26.0은 GPU 활용도와 전반적인 추론 처리량 (inference throughput)을 최적화하는 궤적을 이어갑니다. 이러한 발전은 성능과 폭넓은 모델 지원을 모두 요구하는 로컬 LLM 배포에 있어 vLLM을 더욱 강력한 도구로 만들어 줍니다.
vLLM v0.26.0에 Inkling 모델 지원과 조각별 CUDA 그래프 최적화가 추가된 것은 매우 훌륭합니다. 이는 새로운 모델에 대한 배포를 간소화하고 실질적인 성능 이득을 제공하며, 이는 로컬 GPU 환경에서 처리량을 극대화하는 데 매우 중요합니다.
Stockfish 16.1 체스 엔진 출시, 강력함과 접근성 유지 (Stockfish (chess NNUE))
세계적으로 유명한 오픈 소스 체스 엔진인 Stockfish가 16.1 버전의 공식 출시를 발표했습니다. Stockfish는 지속적으로 세계에서 가장 강력한 체스 엔진 중 하나로 평가받고 있으며, 이에 따라 매 새로운 버전은 체스 애호가, 연구자, 그리고 AI 개발자 모두에게 중요한 이벤트가 됩니다. 이번 릴리스는 Stockfish의 비범한 강력함의 핵심인 신경망 기반 평가 (NNUE, neural network-based evaluation) 기능과 탐색 알고리즘의 점진적인 개선 전통을 이어갑니다. NNUE를 통해 엔진은 방대한 체스 게임 데이터셋으로 학습된 신경망을 활용하여, 무차별 대입 계산 (brute-force calculation)과 결합된 인간과 유사한 직관으로 포지션을 평가할 수 있습니다.
Stockfish 16.1은 Windows, Linux, macOS를 포함한 다양한 운영 체제에서 여전히 자유롭게 다운로드할 수 있습니다. 이러한 접근성은 소비자급 CPU를 가진 누구라도 세계적인 수준의 AI를 실행할 수 있음을 보장하며, 로컬 하드웨어에서 실행 가능한 최적화된 오픈 소스 (open-source) AI의 강력함을 입증합니다. Stockfish의 지속적인 개선은 게임 AI 분야에서 달성 가능한 성과에 대한 강력한 벤치마크 (benchmark) 역할을 하며, 양자화된 추론 (quantized inference)의 발전과 최첨단 체스 엔진을 정의하는 탐색 깊이 (search depth) 및 평가 정확도 사이의 정교한 균형을 보여줍니다.
Stockfish 16.1은 오픈 소스 게임 AI의 힘을 보여주는 또 다른 증거입니다. Stockfish의 지속적인 지배력과 접근성은 고성능의 로컬 실행 가능 AI에 관심이 있는 모든 이들에게 환상적인 벤치마크를 제공합니다.
Full Local AI & Open Models archive
GPU, CUDA 및 자율 주행
오늘의 주요 기술 뉴스는 AMD GPU Operator v1.5.0의 출시를 다룹니다. 이는 동적 자원 할당 (Dynamic Resource Allocation) 및 자동 노드 복구 기능을 통해 Kubernetes 배포를 강화합니다. NVIDIA는 TensorRT에 대한 중요한 업데이트를 제공하여 장시간 실행되는 엔진 빌드를 관찰 및 취소할 수 있도록 했으며, AMD는 ATOM을 사용하여 MI355X GPU에서 Kimi-K2.5-MXFP4를 최적화하는 세부 사항을 공개했습니다.
AMD GPU Operator v1.5.0: DRA 지원, 자동 GPU 노드 복구 및 확장된 Kubernetes 인프라 제어 (AMD ROCm 블로그)
출처: AMD ROCm Blog
AMD GPU Operator가 버전 1.5.0을 출시하여 Kubernetes 환경 내에서 AMD GPU 배포를 오케스트레이션 (orchestrating)하기 위한 중요한 인프라 개선 사항을 제공합니다. 이번 업데이트의 핵심은 Kubernetes 동적 자원 할당 (Dynamic Resource Allocation, DRA)에 대한 강력한 지원입니다. 이 중요한 기능은 사용자가 다양한 워크로드에 GPU 자원을 더욱 유연하고 효율적으로 할당할 수 있도록 지원하며, 수요에 따라 동적으로 적응하고 자원 경합 (resource contention)을 방지함으로써 전체 클러스터 활용도를 최적화합니다.
신뢰성을 더욱 강화하기 위해, 1.5.0 버전은 자동화된 GPU 노드 복구 (remediation) 워크플로우를 도입합니다. 이러한 자동화는 GPU 관련 문제를 겪는 노드를 자동으로 감지하고 복구함으로써, 대규모 AI 학습 및 HPC 추론 배포에서 높은 성능과 업타임 (uptime)을 유지하는 데 필수적입니다. 또한, 이번 업데이트는 일반적인 Kubernetes 인프라 제어 범위를 확장하여, 관리자가 다른 클러스터 리소스와 함께 AMD GPU 하드웨어를 구성하고 관리할 수 있는 더욱 세밀한 옵션을 제공합니다. 이러한 개선 사항들은 복잡한 AI/ML 파이프라인 및 과학적 계산 (scientific computing)을 위한 운영을 종합적으로 단순화하여, AMD Instinct 가속기를 효율적으로 배포하고 관리할 수 있도록 돕습니다.
이번 릴리스는 특히 자동화된 노드 복구와 동적 자원 할당을 통해 Kubernetes 환경에서 AMD GPU 클러스터의 관리 용이성과 안정성을 극적으로 향상시킵니다. 이는 더욱 견고하고 효율적인 MLOps를 향한 거대한 진전입니다.
Python 또는 C++에서 장시간 실행되는 NVIDIA TensorRT 엔진 빌드를 관찰 가능하고 취소 가능하게 만들기 (NVIDIA Developer Blog)
NVIDIA는 관찰 가능성 (observability)과 취소 기능을 활성화하여 TensorRT 엔진 빌드를 더 관리하기 쉽게 만드는 방법을 보여주는 새로운 가이드를 게시했습니다. 모델 체크포인트가 커지고 최적화 프로세스가 복잡해짐에 따라, 대규모 강타입 (strongly-typed) 모델, 심층 전술 탐색 (deep tactic searches), 또는 새로운 GPU SKU에서의 콜드 타이밍 캐시 (cold timing caches) 등의 요인으로 인해 TensorRT 엔진 빌드는 종종 몇 분 또는 그 이상의 시간이 소요될 수 있습니다. 이 블로그 포스트는 Python과 C++ 모두에서 콜백 (callbacks)을 사용하는 방법을 소개하여 빌드 진행 상황에 대한 실시간 업데이트를 제공하고, 진행 중인 빌드를 취소할 수 있는 기능을 제공합니다.
새로운 접근 방식은 개발자가 애플리케이션에 진행 상황 보고(progress reporting)를 통합할 수 있게 하여, 파싱(parsing), 최적화(optimization), 타이밍(timing)과 같은 TensorRT 빌드 프로세스의 다양한 단계에 대한 가시성을 제공합니다. 이 기능은 개발자 경험(developer experience)을 개선하는 데 매우 중요하며, 특히 빠른 피드백과 비효율적인 빌드를 중단할 수 있는 능력이 매우 귀중한 반복적 개발 및 디버깅(debugging) 사이클에서 더욱 그러합니다. 이러한 패턴을 구현함으로써 개발자는 컴퓨팅 사이클의 낭비를 방지하고, NVIDIA GPU에 배포하기 위해 복잡한 신경망(neural networks)을 최적화할 때 워크플로를 효율화할 수 있습니다.
TensorRT 빌드를 관찰하고 취소할 수 있다는 점은 복잡한 모델을 반복 작업할 때 판도를 바꾸는 요소(game-changer)입니다. 이는 특히 추론 파이프라인(inference pipelines)을 미세 조정(fine-tuning)할 때 수많은 개발 시간과 좌절감을 줄여줄 것입니다.
ATOM을 사용하여 MI355X에서 Kimi-K2.5-MXFP4 서빙하기 (AMD ROCm 블로그)
출처: AMD ROCm Blog
AMD의 ROCm 블로그는 ATOM 프레임워크를 사용하여 AMD MI355X GPU에서 Kimi-K2.5-MXFP4 모델을 배포하기 위한 심층적인 최적화 전략을 상세히 설명합니다. 이 게시물은 MoE (Mixture of Experts) 최적화에 관한 이전 작업을 바탕으로 하며, 특히 까다로운 에이전틱 AI(agentic AI) 추론 워크로드에 대해 높은 성능을 달성하기 위한 커널(kernel) 및 양자화(quantization) 기술에 초점을 맞춥니다. 최적화의 핵심은 AMD Quark를 사용하여 W4A8 및 W8A8 양자화를 적용하는 것이며, 이는 대규모 언어 모델(large language models)을 서빙하는 데 있어 상당한 효율성 향상을 입증합니다.
이 기사는 혼합 정밀도 양자화 (mixed-precision quantization)를 위해 ATOM을 활용하는 방법에 대한 포괄적인 가이드를 제공하며, Kimi-K2.5-MXFP4 모델의 지배적인 MoE (Mixture-of-Experts) 부분을 가속화하기 위한 특화된 커널 (specialized kernels)을 구현하는 방법을 상세히 설명합니다. 이를 통해 MI355X 아키텍처에서 최적의 처리량 (throughput)과 감소된 메모리 사용량 (memory footprint)으로 모델을 서빙할 수 있도록 보장합니다. 이러한 심층적인 커널 및 양자화 작업은 LLM 추론 (LLM inference)의 한계를 넓히는 데 필수적이며, 특히 최고 성능을 위해 하드웨어 특화 최적화 (hardware-specific optimizations)에 점점 더 의존하고 있는 대규모, 저지연 에이전틱 AI (agentic AI) 애플리케이션에 있어 매우 중요합니다.
이 가이드는 AMD의 MI355X GPU에서 대규모 언어 모델 (large language models)의 성능을 극대화하기 위한 훌륭하고 실행 가능한 통찰력을 제공합니다. ATOM을 이용한 커널 및 양자화 작업에 대한 집중은 LLM 추론 효율성을 높이는 데 정확히 필요한 부분입니다.
Full GPU, CUDA & Autonomous Driving archive
공식 릴리스 피드, 벤더 변경 로그(changelogs) 및 엔지니어링 블로그에서 매일 컴파일되었습니다. 아카이브: https://media.patentllm.org
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기