
Mac에서 Laguna가 작동한다: Ollama, llama.cpp, vLLM 동시 업데이트의 요점과 5가지 함정
요약
Ollama, llama.cpp, vLLM 등 주요 로컬 LLM 런타임의 대규모 업데이트 소식을 다룹니다. 특히 Mac 환경에서 Laguna 모델을 구동하기 위한 Ollama v0.32.5 업데이트의 중요성과 활용 팁을 설명합니다.
핵심 포인트
- Ollama v0.32.5 업데이트를 통해 Laguna 모델의 NVFP4 양자화 품질 버그 해결
- Apple Silicon 환경에서 MLX 엔진을 통한 Laguna 모델 가속화 지원
- Claude Code 등 클라우드 에이전트와 로컬 Ollama를 연동한 비용 절감 전략
- llama.cpp의 Mamba-2 가속화 및 투기적 디코딩 업데이트 포함
2026년 7월 24일부터 30일까지의 로컬 LLM 관련 움직임을 정리한 기사입니다. 이번 주는 새로운 모델보다는 모델을 구동하는 런타임(Runtime) 측이 주인공이었습니다. Ollama, llama.cpp, vLLM의 3개 계통이 동시에 가속화와 품질 수정을 진행하고 있어, 업데이트할 이유가 명확한 한 주입니다.
이번 주의 전체상 (7/24-7/30)
다룬 내용은 총 9건입니다.
- 7/24: Mage-Flow (Comfy-Org에서 출시한 이미지 계열 모델)
- 7/25: Ollama v0.32.4 (MLX 엔진이 Laguna에 대응)
- 7/27: vLLM v0.26.0 (411개 커밋이 포함된 대형 버전) / Ollama v0.32.5 (NVFP4 품질 버그 수정) / 논문 「Memory for Large Language Models」
- 7/28: llama.cpp b10164 (Mamba-2의 prefill 가속화) / Audio8 TTS Preview 0.6B
- 7/29: llama.cpp b10175 (AMD RDNA 세대별 MMQ 조정 기반)
- 7/30: llama.cpp b10184 (MiMo V2.5의 MTP 층에서 투기적 디코딩(Speculative Decoding))
오늘부터 실질적인 이득이 있는 것은 런타임 계열의 5건이며, 나머지는 관망 대상입니다. 주의할 점은 Ollama의 업데이트 순서로, v0.32.4에 멈춰 있으면 양자화(Quantization) 모델의 출력 품질이 떨어진 상태로 유지됩니다.
활용 구분 × 에이전트 연동 × 비용
Claude Code나 Codex와 같이 클라우드 코딩 에이전트를 주력으로 사용하는 사람에게도 이번 업데이트는 관련이 있습니다. Ollama는 OpenAI 호환 API (연결 대상 URL을 교체하는 것만으로 사용할 수 있는 공통 방식)를 가지고 있어, 로컬 호스트로 향하게 하면 정형 처리의 '하청' 구성을 만들 수 있습니다.
- Claude Code의 hooks (정해진 타이밍에 명령어를 자동 실행하는 메커니즘)를 통해, 커밋 시의 차이점 요약만 로컬로 보낼 수 있습니다.
git diff | ollama run <모델명> "변경 사항을 한 줄로 요약"
위와 같이 시도할 수 있습니다. - MCP (외부 도구와 연결하는 공통 규격)나 커스텀 도구를 통해 하청 모델을 등록할 수 있습니다.
- OpenHands나 cline은 연결 대상 URL 교체만으로 Ollama나 vLLM으로 옮길 수 있습니다.
역할 분담은 기밀 코드의 요약이나 테스트 생성과 같은 정형 처리는 로컬에서, 설계 판단은 클라우드 측에 남기는 형태입니다. 비용의 규모는 개략적으로, Mac 기존 기기라면 추가 투자 제로 + 전기세, 코딩 계열 구독은 월 20달러 클래스, GPU 기기 신규 구매는 수십만 엔 클래스입니다. 손익 분기점은 사용 방식에 따라 다르므로, 우선 하청 업무 하나부터 시작하는 것이 현실적입니다.
Ollama v0.32.5: Mac에서 Laguna를 구동하기
7월 25일의 v0.32.4에서 Apple Silicon 전용 머신러닝 프레임워크인 MLX를 사용하는 엔진이 신모델 Laguna에 대응했습니다. 릴리스 노트에 따르면, M5 Max에서 일부 투영(Projection) 처리가 4~9% 빨라졌습니다.
하지만 이번 주의 가장 큰 함정이 여기에 있습니다. v0.32.4의 MLX에는 Laguna의 배포 형식인 NVFP4 (4비트 계열 양자화 형식)의 출력 품질을 떨어뜨리는 버그가 있었으며, 이틀 뒤인 v0.32.5에서 수정되었습니다. 업데이트를 한다면 v0.32.5까지 한 번에 올려야 합니다.
ollama -v # 0.32.5 이상인지 확인
ollama pull laguna-xs-2.1:nvfp4
ollama run laguna-xs-2.1:nvfp4 --verbose
Laguna의 파라미터 수는 공식적으로 미공개 상태이므로, 필요한 메모리는 Ollama 라이브러리의 사이즈 표기에서 확인하시기 바랍니다.
llama.cpp: 가속화 3연발 (MTP / Mamba-2 / AMD)
GGUF 모델을 구동하는 본가인 llama.cpp에는 성격이 다른 가속화가 3건 포함되었습니다.
가장 큰 것은 7월 30일의 b10184입니다. MiMo V2.5 계열에서 모델 내장 MTP 층을 투기적 디코딩(Speculative Decoding)에 사용할 수 있게 되었습니다. 투기적 디코딩은 초안 작성 역할이 먼저 토큰을 내놓으면 본체가 검산하는 가속화 방식이며, MTP는 그 초안을 모델 스스로가 보유하는 메커니즘입니다. 외부 드래프트 모델을 선택하는 번거로움이 없어졌으며, 공식 PR 검증에서는 Metal과 CUDA 모두에서 9~12%의 가속화를 보였습니다.
두 번째는 28일의 b10164입니다. CUDA 환경의 Mamba-2에서 prefill (프롬프트 읽기 전처리)이 병렬화되었으며, PR 측정 결과 조건에 따라 약 20% 단축되었습니다. 다만 빨라지는 것은 초기 단계뿐이며 생성 속도는 변하지 않고, 추가 메모리와의 트레이드오프(Trade-off)도 지적되고 있습니다.
세 번째인 b10175는 AMD RDNA 3 / 3.5 / 4에서 커널 설정을 세대별로 조정할 수 있는 기반입니다. 개선 사항과 정체된 조건이 혼재되어 있어, 상황을 지켜봐야 하는 단계입니다.
모든 수치는 검증 환경에서의 값이므로, 직접 확인하려면 llama-bench를 통해 업데이트 전후의 t/s (초당 토큰 수)를 비교하는 것이 확실합니다.
vLLM v0.26.0: 411개의 커밋이 포함된 대규모 업데이트
GPU 서버에서 높은 처리량 (Throughput)을 내는 추론 런타임인 vLLM은, 릴리스 노트에 기재된 대로 411개의 커밋과 212명이 참여한 대규모 업데이트입니다. 핵심은 Thinking Machines Lab의 신형 멀티모달 모델인 Inkling에 대한 일괄 지원으로, 기본 추론에 더해 LoRA (작은 차분만을 추가 학습하는 기법), 투기적 디코딩 (Speculative Decoding), NVFP4 양자화 (Quantization)까지 공개 첫날부터 모두 갖추어져 있습니다.
그 외에도 DeepSeek-V4를 위한 최적화, KV 캐시 (KV Cache, 과거 토큰의 계산 결과 재사용) 단위로 Attention 방식을 선택할 수 있는 변경 사항, 출력 헤드를 fp32로 다루는 선택지가 추가되어 품질 측면에서도 개선되었다는 인상을 줍니다. 기본적으로 Linux + GPU를 전제로 하므로, Mac 사용자에게는 앞서 언급한 Ollama 장이 핵심입니다.
비교 매트릭스와 5가지 함정
| llama.cpp | Ollama | vLLM | MLX |
|---|---|---|---|
| 역할 | 범용 GGUF 실행의 기반 | 간편한 모델 관리 | GPU 서버 고처리량 |
| ... |
개인 GPU는 1인 용도라면 llama.cpp, 다수 인원이나 API 호환성을 위해 사용한다면 vLLM을 기준으로 삼는 것이 좋습니다. 확인이 필요한 부분은 모델 측의 라이선스입니다.
이번 주의 함정을 5가지로 정리합니다.
- Ollama 업데이트는 v0.32.5까지 한 번에 진행할 것 (v0.32.4에 멈추면 품질 버그가 남음)
- 가속화 수치는 각 검증 환경에서의 값임. 직접 실측할 것
- Mamba-2의 가속화는 초기 단계일 뿐이며, 생성 속도는 변하지 않음
- AMD RDNA의 MMQ 조정은 조건에 따라 정체되거나 소폭 저하될 수도 있음
- Docker / CI는 런타임의 버전을 태그로 고정할 것
인사이트 투어: 지켜봐야 할 3가지
- Audio8 TTS Preview 0.6B: 경량 로컬 음성 합성 프리뷰 버전. 지원 언어와 라이선스는 모델 카드 확인 필요
- 논문 「Memory for Large Language Models」: LLM의 기억 메커니즘을 체계적으로 정리한 서베이(Survey). 로컬에서 에이전트를 구성할 때, 문맥을 어디에 저장할지 고민할 때 필요한 어휘를 갖출 수 있음
- Mage-Flow: 공개 며칠 만에 다운로드 4.4만 건 달성. 상세 내용은 모델 카드 확인 대기 중
이번 주 총괄
팀에서 질문을 받는다면 "로컬 LLM은 비용 최적화 검증을 시작할 시기"라는 한 문장으로 답하겠습니다. 다만 실제 도입은 품질 버그 수정에 대응할 수 있는 체계가 전제되어야 합니다. 실행 리스트는 3가지입니다. Ollama를 v0.32.5까지 올려 Laguna를 구동할 것, llama.cpp의 MTP 대응을 llama-bench로 전후 실측할 것, GPU 서버 사용자라면 vLLM v0.26.0으로 업데이트할 것입니다.
영상 내의 관점으로 보자면, 3개 계통이 동시에 투기적 디코딩과 양자화 품질에 손을 댄 것은 가속화의 주전장이 그쪽으로 옮겨갔다는 신호로 보고 있습니다. MTP 방식의 대응이 8월 중에 다른 모델로 확산되지 않는다면, 이 예측은 틀린 것이 됩니다.
출처
- Ollama v0.32.4
- Ollama v0.32.5
- Ollama MLX 엔진 해설
- Ollama OpenAI 호환 API
- vLLM v0.26.0
- Inkling 해설 (vLLM 공식 블로그)
- llama.cpp b10184 (MiMo MTP 투기적 디코딩)
- MiMo V2.5 MTP 대응 PR
- llama.cpp b10164 (Mamba-2 prefill 가속화)
- llama.cpp b10175 (RDNA별 MMQ 조정)
- Audio8 TTS Preview 0.6B
- 논문 Memory for Large Language Models
- Mage-Flow (Comfy-Org)
자세한 내용은 영상에서
각 업데이트의 화면과 실행 절차는 영상에서 확인할 수 있습니다.
채널에서는 매주 로컬 LLM 및 코딩 에이전트 요약본을 공개하고 있습니다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기