Ollama v0.32.4 Apple MLX 지원 도입 — Rubin, llama.cpp 및 GPU 업데이트 포함
요약
Ollama v0.32.4 업데이트를 통해 Apple MLX 지원과 양자화된 투기적 디코딩 기능이 도입되었습니다. 또한 llama.cpp는 Minimax-M3 모델에 대한 예비 비전 지원을 추가하며 멀티모달 AI로 영역을 확장하고 있습니다.
핵심 포인트
- Ollama v0.32.4: Apple Silicon 사용자를 위한 MLX 엔진 지원 및 가속 추론 구현
- 양자화된 투기적 디코딩 도입으로 로컬 LLM 추론 효율성 및 정확도 개선
- llama.cpp: Minimax-M3 비전 통합을 통한 멀티모달 AI 기반 마련
- NVIDIA Rubin 아키텍처 및 AMD ROCm 7.14.0 등 하드웨어/런타임 업데이트 포함
오늘의 요약은 새로운 Apple MLX GPU 지원을 포함한 Ollama v0.32.4와 llama.cpp의 예비 비전 (vision) 기능 확보를 강조합니다. 또한, AMD ROCm 7.14.0 및 TensorRT-LLM 출시와 NVIDIA의 Rubin GPU 아키텍처에 대한 세부 정보도 다룹니다.
로컬 AI 및 오픈 모델 (Local AI & Open Models)
Ollama v0.32.4는 강력한 Apple GPU MLX 지원과 효율적인 로컬 추론 (inference)을 위한 고급 양자화된 투기적 디코딩 (quantized speculative decoding)을 제공합니다. 동시에, llama.cpp는 예비적인 Minimax-M3 비전 통합을 통해 멀티모달 (multimodal) AI로 영역을 확장하며, YaneuraOu Shogi 엔진은 번들로 제공되는 GPU 런타임 (runtimes)의 지원을 받아 NPS가 30% 대폭 향상되었습니다.
Ollama v0.32.4, Laguna를 위한 Apple GPU MLX 지원 도입 및 양자화된 투기적 디코딩 강화 (Ollama)
출처: Ollama
v0.32.4 릴리스는 특히 Apple Silicon 하드웨어 사용자들을 위한 로컬 AI 추론 (inference) 능력을 크게 향상시킵니다. 이번 업데이트는 Apple의 MLX 엔진을 통해 Laguna 모델 제품군에 대한 지원을 도입하여, 통합 GPU를 활용한 가속 추론을 구현합니다. 이러한 통합은 Mac 장치에서 대규모 언어 모델 (LLM)을 직접 실행할 때 성능과 효율성을 개선할 것을 약속하며, 로컬 개발 및 실험을 위해 강력한 AI를 더욱 쉽게 사용할 수 있게 합니다.
로컬 추론 기술을 더욱 발전시키기 위해, Ollama v0.32.4는 초안 모델 (draft-model)의 출력 헤드 (output heads)를 요청된 유형으로 양자화함으로써 투기적 디코딩 (speculative decoding)을 개선합니다. 이 최적화는 더 작고 빠른 모델이 더 크고 정확한 모델을 위해 토큰을 예측하는 방식인 이 가속 기법을 사용하여 텍스트를 생성할 때 효율성과 정확성을 유지하는 데 도움을 줍니다. 또한 이번 릴리스는 서로 다르게 양자화된 전문가 (experts) 모델에서 발생했던 Qwen3 MoE 디코딩 문제를 수정하는 등 중요한 버그 수정을 포함하며, 이 인기 있는 오픈 웨이트 (open-weight) 모델에 대해 다양한 양자화 방식 전반에서 일관된 성능을 보장합니다.
MLX 통합은 Mac 사용자들에게 게임 체인저가 될 것이며, 양자화된 투기적 디코딩 (speculative decoding) 개선은 모든 사용자, 특히 Qwen3와 같은 복잡한 MoE 모델에 대해 더 빠르고 효율적인 로컬 추론 (local inference)을 의미합니다.
llama.cpp b10142, Minimax-M3를 위한 예비 비전 지원 추가 (llama.cpp)
출처: llama.cpp
최신 llama.cpp 릴리스인 b10142는 Minimax-M3 모델에 대한 예비 비전 (vision) 지원을 추가함으로써 기능의 상당한 확장을 나타냅니다. 현재는 기존 구성 요소를 재사용하는 텍스트 전용 포트이지만, 이번 업데이트는 로컬 하드웨어에서 직접 멀티모달 (multimodal) AI 추론을 수행하기 위한 기반을 마련합니다. 이 통합은 per-head QK-norm 및 부분적 회전 임베딩 (partial rotary embeddings)을 포함한 Minimax-M2 스타일의 그룹 쿼리 어텐션 (Grouped-Query Attention, GQA)과 DeepSeek-V3 스타일의 리드 토큰 (lead token) 처리를 활용합니다.
이러한 발전은 기초적인 llama.cpp 프레임워크가 텍스트 외에도 시각적 정보를 처리하고 이해하기 시작할 수 있게 함으로써 로컬 AI를 발전시키는 데 매우 중요합니다. 개발자와 애호가들에게 이는 소비자급 CPU 및 GPU에서 멀티모달 모델을 실행할 수 있는 잠재력을 의미하며, 더 정교한 AI 애플리케이션에 대한 접근성을 민주화합니다. 초기 텍스트 전용 포트는 아키텍처 호환성에 집중하며, 향후 반복 버전에서 완전한 시각적 처리를 위한 무대를 마련하고 로컬 멀티모달 AI 탐색을 위한 새로운 길을 열어줍니다.
llama.cpp에 비전 지원을 추가하는 것은 로컬 멀티모달 AI를 위한 거대한 도약이며, 고급 모델이 소비자용 하드웨어에서도 효율적으로 실행될 수 있음을 증명합니다. 이는 로컬 추론이 나아갈 방향을 보여주는 명확한 지표입니다.
ふかうら王 V9.40 쇼기 엔진, NPS 30% 향상 달성 및 CUDA/TensorRT/cuDNN 런타임 포함 (やねうら王 / YaneuraOu (将棋))
ふかうら王 V9.40의 출시는 인기 있는 YaneuraOu Shogi 엔진의 상당한 발전을 의미하며, 작은 모델에 대해 초당 노드 수 (NPS, Nodes Per Second)가 약 30% 향상되는 유의미한 성능 향상을 제공합니다. 이러한 탐색 속도의 개선은 더 강력한 플레이와 더 효율적인 분석으로 직접 이어지며, 이는 경쟁적인 Shogi AI에 있어 결정적인 요소입니다. V9.40 업데이트에는 CUDA, TensorRT, cuDNN을 포함하는 포괄적인 런타임 번들링 (runtime bundling)도 포함되어 있어, NVIDIA 하드웨어를 사용하는 사용자의 설정을 간소화하고 최적화된 GPU 추론 (inference)을 보장합니다.
단순한 속도를 넘어, ふかうら王 V9.40은 入玉特徴量 (nyugyoku features, 입옥 특징량) 지원을 도입하여, 왕이 상대 진영으로 들어가는 복잡한 엔드게임 (end-game) 시나리오를 처리하는 데 중요한 NNUE 평가 함수 (evaluation function)의 잠재적인 개선을 시사합니다. 이러한 평가 측면의 기술적 개선은 패키징된 런타임과 결합되어, 더 넓은 범위의 사용자가 엔진을 더 쉽게 사용하고 높은 성능을 낼 수 있도록 합니다. GPU 가용 여부와 관계없이 폭넓은 호환성을 보장하기 위해 Windows x64 CPU 전용 버전도 제공되지만, 가장 높은 NPS 이득은 일반적으로 GPU 가속 (acceleration)을 통해 관찰된다는 점을 강조합니다.
CUDA/TensorRT/cuDNN이 사전 번들링되어 NPS가 30% 향상되었다는 것은 Shogi 플레이어와 연구자들에게 즉각적이고 강력한 업그레이드를 의미합니다. 이번 출시는 게임 AI가 효율적인 로컬 추론 (local inference)의 한계를 어떻게 밀어붙이는지를 보여주는 전형적인 사례입니다.
Full Local AI & Open Models archive
GPU, CUDA 및 자율 주행
오늘의 주요 기술 뉴스는 NVIDIA가 Agentic AI를 위한 Rubin GPU 아키텍처를 공개한 소식과 함께, NVIDIA 및 AMD 양측의 중요한 공식 소프트웨어 출시를 다룹니다. ROCm 7.14.0은 AMD의 오픈 컴퓨팅 스택 (open compute stack)을 위한 새로운 빌드 시스템을 도입했으며, TensorRT-LLM v1.3.0rc22는 NVIDIA GPU에서의 LLM 추론 최적화를 강화합니다.
AMD ROCm 7.14.0 출시 (AMD ROCm)
출처: AMD ROCm
AMD는 ROCm Core SDK 7.14.0을 공식적으로 출시하였으며, 이는 새로운 빌드 및 릴리스 시스템인 "TheRock"으로의 중요한 전환을 의미합니다. 이번 업데이트는 AMD의 오픈 컴퓨팅 플랫폼(open compute platform)에 대한 유연성, 유지보수성 및 커뮤니티 표준과의 정렬을 강화하기 위한 모듈형 아키텍처(modular architecture)를 도입합니다. AMD Instinct™ GPU를 활용하는 개발자와 연구자들은 AI 및 HPC 워크로드에 대한 기초적인 안정성과 통합 능력의 향상을 기대할 수 있습니다.
ROCm 7.14.0의 모듈형 설계는 향후 개발 및 통합을 간소화하여, 기여자(contributors)가 프레임워크를 더 쉽게 다룰 수 있게 하고 사용자가 사용자 정의 구성(custom configurations)을 더 쉽게 배포할 수 있도록 의도되었습니다. 이번 릴리스는 AMD 하드웨어 기반의 고성능 컴퓨팅(high-performance computing) 및 인공지능(artificial intelligence)을 위한 더욱 견고하고 적응력 있는 생태계를 뒷받침합니다. "TheRock"으로의 전환은 GPU 프로그래밍을 위한 선도적인 오픈 소스 대안으로서 ROCm을 발전시키려는 AMD의 의지를 나타내며, 개발자 커뮤니티와 기업 사용자들에게 장기적인 이점을 약속합니다.
ROCm 7.14.0으로 업그레이드하는 것은 AMD 사용자들에게 중요한 단계입니다. 'TheRock' 빌드 시스템은 더 나은 장기적 안정성과 더 쉬운 사용자 정의 모듈 통합을 약속하며, ROCm 개발을 더욱 원활하게 만듭니다.
TensorRT-LLM v1.3.0rc22 출시 (TensorRT-LLM)
출처: TensorRT-LLM
NVIDIA는 NVIDIA GPU에서 대규모 언어 모델(large language model) 추론을 가속화하도록 설계된 강력한 라이브러리의 릴리스 후보(release candidate)인 TensorRT-LLM v1.3.0rc22를 출시했습니다. 이번 업데이트는 알려진 여러 문제들을 해결하며, 특히 PyTorch 컴파일 백엔드에서 torch.compile 충돌과 관련된 안정성 문제를 중점적으로 다룹니다. 또한, torch_compile=True 설정 시 remove_copy 패스(pass) 도중 특정 멀티 GPU 정확도 경로에서 KeyError가 발생할 수 있음을 명시하였으며, 이는 bf16, FP8, NVFP4를 포함한 다양한 부동 소수점 형식(floating-point formats)에서 DeepSeek-V3-Lite 및 Llama-3.1-8과 같은 모델에 영향을 미칩니다.
이번 릴리스는 LLM (Large Language Model) 배포를 최적화하기 위해 TensorRT-LLM에 의존하는 개발자들에게 매우 중요합니다. 이러한 문제들을 식별하고 상세히 설명함으로써, NVIDIA는 최신 PyTorch 통합 및 고급 양자화 (quantization) 기법을 사용하는 사용자들에게 투명성과 가이드를 제공합니다. 릴리스 후보 (release candidate) 단계이지만, 진행 중인 개선 사항과 알려진 제한 사항을 미리 살펴볼 수 있게 하여, 사용자들이 안정적인 릴리스에 대비하고 NVIDIA 하드웨어에서 성능과 정확도를 극대화할 수 있도록 개발 워크플로를 적절히 조정할 수 있게 합니다.
이 TensorRT-LLM rc22는 NVIDIA 하드웨어에서 최첨단 LLM을 구동하려는 모든 이들에게 필수적입니다.
torch.compile및 멀티 GPU 문제를 인지하는 것이 FP8과 같은 고급 포맷을 사용한 안정적인 배포의 핵심입니다.
NVIDIA Rubin GPU 아키텍처 내부 살펴보기: 에이전틱 AI (Agentic AI) 시대의 동력 (NVIDIA Developer Blog)
NVIDIA는
이 블로그 게시물은 에이전틱 AI (Agentic AI)가 단순한 원시 연산 능력 (raw compute power)뿐만 아니라 정교한 메모리 및 인터커넥트 (interconnect) 솔루션을 필요로 한다는 점을 강조합니다. 구체적인 기술 사양은 완전히 공개되지 않았으나, 이번 발표는 차세대 AI 애플리케이션에 최적화된 아키텍처에 집중하는 NVIDIA의 하드웨어 혁신 전략 방향을 시사합니다. Rubin 아키텍처에 대한 이러한 통찰은 GPU 성능의 미래와 AI 혁명을 뒷받침하는 핵심 하드웨어를 발전시키려는 NVIDIA의 의지를 보여주며, 향후 돌파구를 위한 토대를 마련합니다.
Rubin GPU 아키텍처는 중요한 로드맵 항목입니다. NVIDIA의 차세대 실리콘 방향을 이해하는 것은 미래의 AI 인프라를 계획하고 에이전틱 AI (agentic AI) 워크로드를 위한 성능 도약을 예측하는 데 매우 중요합니다.
Full GPU, CUDA & Autonomous Driving archive
공식 릴리스 피드, 벤더 변경 로그(changelogs) 및 엔지니어링 블로그를 통해 매일 편집되었습니다. 아카이브: https://media.patentllm.org
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기