LLaMA.cpp + TurboQuant 환경에서 Qwen을 위한 Multi-Token Prediction (MTP) 구현
요약
LLaMA.cpp와 TurboQuant 환경에서 Qwen 모델을 위한 Multi-Token Prediction(MTP) 기술을 구현하여 추론 성능을 대폭 향상시켰습니다. MacBook Pro M5 Max 환경에서 테스트한 결과, 초당 토큰 생성 속도가 21 tokens/s에서 34 tokens/s로 약 40% 증가하였으며 90%의 높은 수락률을 기록했습니다.
핵심 포인트
- LLaMA.cpp와 TurboQuant 조합에 MTP를 적용하여 추론 속도 40% 향상
- MacBook Pro M5 Max(64GB RAM) 로컬 환경에서 34 tokens/s 성능 달성
- Qwen 3.6 27B 및 35B 모델에 대해 MTP가 적용된 GGUF 양자화 모델 제공
- MTP와 TurboQuant가 통합된 패치된 LLaMA.cpp 오픈소스 공개
TurboQuant를 사용하여 LLaMA.cpp 상에서 Qwen을 위한 Multi-Token Prediction (MTP)을 구현했습니다.
성능 40% 향상! 수락률(acceptance rate) 90%.
MacBook Pro M5 Max 64GB RAM에서 로컬로 실행 중입니다.
출력 결과:
LLaMA.cpp + TurboQuant: 21 tokens/s
LLaMA.cpp + TurboQuant + MTP: 34 tokens/s
MTP와 TurboQuant를 적용하여 패치된 LLaMA.cpp: https://github.com/AtomicBot-ai/atomic-llama-cpp-turboquant
MTP를 적용하여 Qwen 3.6 27B (및 35B)를 GGUF로 양자화(Quantized)한 모델: https://huggingface.co/collections/AtomicChat/qwen-36-udt-mtp
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기