
Ollama, Mac에서 Qwen3.5 MTP 자동 활성화 지원 (이전 Metal 테스트에서는 11–27% 더 느렸음)
요약
Ollama 0.32.6-rc0 버전에서 Apple Silicon 사용자를 위한 Qwen3.5 MTP(Multi-Token Prediction) 자동 활성화 기능이 추가되었습니다. MLX 백엔드를 통해 별도의 설정 없이도 추측적 디코딩을 지원하며, 적응형 깊이 컨트롤러를 통해 성능을 최적화합니다.
핵심 포인트
- Qwen3.5 모델의 MTP 헤드를 MLX 백엔드가 자동 로드하여 추측적 초안으로 활용
- 별도의 초안 모델이나 수동 플래그 설정 없이 자동 최적화된 생성 가능
- 수락률과 비용을 기반으로 추측적 깊이(speculative depth)를 동적으로 조정
- 요청별 통계(수락률, 평균 깊이 등)를 통해 성능 모니터링 지원
Ollama 0.32.6-rc0 버전은 Apple Silicon 사용자들에게 매우 중요한 기능이 될 만한 요소를 추가했습니다. Qwen3.5 모델에 내장된 MTP 텐서(tensors)가 포함되어 있을 때, 이제 Ollama의 MLX 백엔드(backend)가 해당 헤드(head)를 자동으로 로드하여 모델 자체를 추측적 초안(speculative draft)으로 사용합니다. 따라서 다음과 같은 특징이 있습니다:
- 별도의 초안 모델(draft model) 불필요
- 활성화를 위한 추가 플래그(flag) 불필요
- 수동적인 초안 깊이(draft-depth) 튜닝 불필요
- 생성된 출력물에 의도적인 변화 없음
MTP 헤드는 단계마다 하나의 토큰을 제안하며, Ollama의 컨트롤러(controller)는 측정된 비용(cost)과 수락률(acceptance rate)을 기반으로 추측적 깊이(speculative depth)를 조정합니다. 새로운 빌드는 또한 다음과 같은 요청별 통계(per-request stats)를 기록합니다:
- 초안 생성 및 수락된 토큰 수
- 수락률 (Acceptance rate)
- 평균 및 최대 초안 깊이
- 평균 수락 길이
- 생성 중 선택된 깊이의 변화 방식
이상한 점은 Ollama의 릴리스 노트(release notes)에 단지 "Qwen3.5가 Apple GPU에서 더 빨라졌습니다"라고만 명시되어 있다는 것입니다. 실제 전후 비교 수치는 없습니다. 그리고 제가 찾은 이전의 공개 결과는 정반대의 방향을 가리키고 있습니다. M1 Max에서 Qwen3.5-9B Q4_K_M을 사용한 llama.cpp 테스트 결과(temperature 0 기준, 2,048 토큰 생성)는 다음과 같습니다:
- MTP 꺼짐: 25.3 tok/s
- MTP 사용 (n_max 0): 100% 수락률에도 불구하고 22.4 tok/s
- MTP 사용 (n_max 2): 21.9 tok/s
- MTP 사용 (n_max 6): 19.3 tok/s
Thinking(사고 과정) 기능을 비활성화했을 때, 최악의 설정에서는 25.1에서 18.3 tok/s로 떨어졌습니다. 해당 테스트는 Ollama의 MLX 백엔드가 아닌 llama.cpp의 Metal 백엔드를 사용했으므로, 직접적인 비교(apples-to-apples)가 가능한 모순은 아닙니다. 사실, 그 점이 흥미로운 부분일 수 있습니다. Ollama는 이전에 자사의 MLX MTP 구현이 코딩 에이전트(coding-agent) 벤치마크에서 Gemma 4를 평균적으로 거의 90% 더 빠르게 만들었다고 보고한 바 있습니다. 어쩌면 MTP 지원 자체보다 백엔드와 적응형 깊이 컨트롤러(adaptive depth controller)가 더 중요한 요소일지도 모릅니다.
다음 사항들을 비교해 보는 것이 유용할 것입니다:
- Ollama 0.32.5 vs 0.32.6-rc0
- 완전히 동일한 Qwen3.5 모델 및 양자화 (quant)
- 동일한 프롬프트 (prompt), 컨텍스트 (context) 및 온도 (temperature)
- 최소 1,000개의 생성된 토큰 (tokens)
- 첫 실행뿐만 아니라 워밍업이 완료된 실행 (warm runs)
Mac 칩, 통합 메모리 (unified memory), 모델, 양자화 (quant), 컨텍스트 크기 (context size), 적용 전/후의 초당 토큰 수 (tok/s), 그리고 투기적 수락 (speculative acceptance) 통계치를 포함해 주세요. 이것은 아직 출시 후보 (release candidate) 단계이며, Ollama 측에서 자체적인 수치를 발표하지는 않았습니다. 하지만 만약 MLX가 Metal에서 성능 저하(regression)를 일으켰던 요소를 실제 속도 향상으로 바꾼다면, 이는 Ollama 자체를 넘어 매우 유용한 결과가 될 것입니다.
Ollama 릴리스: https://github.com/ollama/ollama/releases/tag/v0.32.6-rc0
MTP 구현: https://github.com/ollama/ollama/commit/4f9d09ef521f3caa8e88d3e40eba428173c88c8c
이전 llama.cpp/Metal 테스트: https://github.com/ggml-org/llama.cpp/issues/23752
/u/BTA_Labs가 r/LocalLLaMA에 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기