llama.cpp MTP 투기적 디코딩(speculative decoding) 요약: 2026년 7월 기준 Dense 모델에서는 큰 이득
요약
llama.cpp에 도입된 네이티브 MTP(Multi Token Prediction) 기반 투기적 디코딩 기술을 정리합니다. Dense 모델에서는 1.4~2.2배의 성능 향상을 보이지만, MoE 모델에서는 이득이 적거나 거의 없는 것으로 나타났습니다.
핵심 포인트
- llama.cpp의 --spec-type draft-mtp를 통한 네이티브 MTP 지원
- Dense 모델(Qwen3.6 등)에서 유의미한 추론 속도 향상 확인
- MoE 모델은 낮은 활성 파라미터 비용으로 인해 MTP 효과가 미미함
- 기존 초안 모델 방식보다 네이티브 MTP 헤드가 더 신뢰할 수 있는 수단임
llama.cpp의 투기적 디코딩 (speculative decoding)에 대한 논의가 몇 달 전 다소 산만했기에, 상황이 정리된 지금 현재 상태를 통합하여 정리하고자 합니다. 요약하자면: --spec-type draft-mtp를 통해 네이티브 MTP (multi token prediction, 다중 토큰 예측) 지원이 도입되었으며, 이를 통해 모델이 별도의 초안 모델 (draft model) 대신 자체적으로 내장된 MTP 헤드 (heads)를 사용할 수 있게 되었습니다. Qwen3.6, DeepSeek, 그리고 GLM은 모두 이 기능을 사용할 수 있는 MTP 헤드를 탑재하여 출시되었습니다. 이전의 투기적 체크포인팅 (speculative checkpointing) 병합 (지난 4월의 PR #19493)은 하이브리드/순환 구조 (hybrid/recurrent architectures)에서 이 기능이 안정적으로 작동할 수 있게 만든 기초 작업이었습니다. 기존의 롤백 (rollback) 방식은 해당 구조들에서 제대로 작동하지 않았기 때문입니다. 실제 결과는 아키텍처에 따라 상당히 갈립니다: Dense 모델: 진정으로 견고한 이득을 보여주며, 사람들은 Qwen3.6-27B dense와 같은 모델에서 약 1.4배에서 2.2배 사이의 성능 향상을 보고하고 있습니다. MoE 모델: 이득이 훨씬 적거나 때로는 전혀 없습니다. 그 이유를 생각해보면 논리적으로 타당합니다: MoE는 이미 디코드 (decode) 단계당 활성 파라미터 (active param) 비용이 작기 때문에, MTP가 절약할 수 있는 오버헤드가 적습니다. Gemma 4에서도 동일한 패턴이 나타났는데, dense 31B 모델은 큰 MTP 성능 향상을 보인 반면, MoE 변형 모델은 거의 변화가 없었습니다. 기존 방식의 투기적 디코딩 (별도의 작은 초안 모델, ngram 매칭)은 독립적인 검증 결과가 엇갈린다는 점을 유의할 필요가 있습니다. 단일 RTX 3090을 사용한 Qwen3.6-35B-A3B에 대한 최소 하나 이상의 상세 벤치마크에서는 ngram-cache, ngram-mod, 또는 클래식 초안 모델 방식에서 순수 속도 향상이 발견되지 않았으며, 일부 설정에서는 오히려 성능이 저하되기도 했습니다. 따라서 속도를 높이려 한다면, 오래된 초안 모델 트릭보다는 네이티브 MTP 헤드가 현재로서는 더 신뢰할 수 있는 수단으로 보입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기