단일 3090 GPU에서 Qwen3.8-27B 성능 테스트: 커스텀 메가커널 적용 시 코드 생성 속도
요약
작성자는 Claude Opus 5.5를 활용하여 RTX 3090 GPU 환경에서 Qwen3.8-27B 모델의 코드 생성 속도를 향상시킨 결과를 공유했습니다. 커스텀 CUDA 메가커널을 적용한 결과, 기존 llama.cpp 대비 코드 작성 및 컨텍스트 처리 등 전반적인 성능이 1.4배~1.9배 빨라졌습니다.
핵심 포인트
- Qwen3.8-27B 모델의 속도 향상 테스트 결과를 공유함.
- 커스텀 메가커널은 llama.cpp 대비 코드 생성 속도를 최대 1.9배 높임.
- 전체 추측 디코딩 사이클을 하나의 커널로 처리하여 효율성을 극대화함.
- OpenAI와 호환되어 기존 llama 서버의 대체품으로 사용 가능함.
저는 Claude Opus 5.5를 사용하여 PC(rtx 3090)에서 Qwen3.8-27B의 속도를 높였습니다. 이 모델은 CUDA 메가커널을 작성했는데, 이는 작업/컨텍스트 길이에 따라 llama.cpp보다 1.4~1.9배 빠릅니다. 결과와 코드는 아래에 있습니다:
결과 (동일 하드웨어, 제 메가커널 vs MTP를 사용한 llama.cpp):
- 코드 작성: 140 tok/s 대 73 tok/s (1.9배 빠름)
- 컨텍스트에 포함된 4K 토큰 파일 코딩: 95 tok/s 대 56 tok/s (1.7배 빠름)
- 프롬프트 처리(prefill): 약 1,600 tok/s 대 약 1,100 tok/s (1.4배 빠름)
이 속도 향상은 전체 추측 디코딩(speculative-decoding) 사이클을 하나의 커널 실행으로 처리하기 때문에, 4~5개의 초안 토큰을 확인하는 비용이 하나를 확인하는 것과 거의 같다는 데서 나옵니다. 이는 OpenAI와 호환되는 서버이므로 llama 서버의 드롭인 대체품으로 작동합니다.
주의사항 및 한계점:
- 이 커널은 3090에서 unsloth의 Q4_K_M 모델 하나에 맞춰 제작되었습니다.
- 출력 결과는 거의 동률인 경우를 제외하고는 llama.cpp와 일치합니다.
- KVCache는 최대 약 80k 컨텍스트까지 fp16을 사용하며, 그 이후에는 q8을 사용합니다.
코드 및 전체 벤치마크: https://github.com/L-Forster/open-jet/tree/master/megakernel (제출자: /u/Adorable_Weakness_39) [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기