Headless RTX 3090 환경에서 Qwen3.6 27B 모델을 활용한 llama.cpp MTP 성능 테스트 결과
요약
RTX 3090 환경에서 Qwen2.5-27B-MTP 모델을 사용하여 llama.cpp의 MTP(Multi-Token Prediction) 성능을 테스트한 결과입니다. MTP 사용 시 프롬프트 처리(PP) 속도는 다소 감소하지만, 텍스트 생성(TG) 속도가 85% 향상되어 전체 작업 시간을 약 41% 단축하는 효과를 확인했습니다.
핵심 포인트
- MTP 사용 시 텍스트 생성(TG) 속도가 27 toks/s에서 50 toks/s로 약 85% 증가함
- 프롬프트 처리(PP) 속도는 1,050 tok/s에서 600 tok/s로 약 42% 감소함
- 85,000 토큰 작업 기준, 전체 소요 시간이 39분에서 23분으로 약 1.7배 단축됨
- PP 비중이 압도적으로 높지 않다면 MTP 도입을 통해 전체적인 처리 효율을 크게 높일 수 있음
PP (Prompt Processing)가 더 느리다는 게시물들을 보고 사용을 주저하는 분들이 있는 것을 보았습니다.
여기 실제 데이터 포인트를 공유합니다.
설정 (Settings):
- Headless RTX 3090 24G
- OpenCode
- 모델: unsloth의 Qwen3.6-27B-MTP-Q4_K_M.gguf
- 128k 컨텍스트 (context)
- q8_0 KV 캐시 (kv cache)
- --spec-draft-n-max: 3
- --draft-p-min: 0
사용 사례 (Use Cases):
- 약 85,000 토큰을 사용하는 연구 작업 (Research task)
- 약 85,000 토큰을 사용하는 코딩 작업 (Coding task)
MTP 미사용 시 (llama.cpp:server-cuda13-b9174):
- PP: 1,050 tok/s
- TG (Text Generation): 27 toks/s
- 85k 토큰 완료까지 총 소요 시간: 약 39분
MTP 사용 시 (최신 master fork):
- PP: 600 tok/s (42% 감소)
- TG: 50 tok/s (85% 증가)
- 85k 토큰 완료까지 총 소요 시간: 약 23분 (1.7배 빠름 또는 41% 시간 단축)
41%의 시간 절감은 매우 엄청난 수치이므로, PP 비중이 매우 높은 경우가 아니라면 여러분의 사용 사례에서도 MTP를 시도해 보길 권장합니다! 저는 듀얼 에이전트 (dual agent) 설정에서 사용 중인데, 다른 비평가 에이전트 (critic agent)가 메인 에이전트의 작업을 검토하기 때문에 전체 처리 시간은 더 개선될 수도 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기