
홈 랩에서의 첫 Kimi K3 결과 ~ 4t/s
요약
768GB DDR5와 RTX 5090 2개를 활용한 홈 랩 환경에서 Kimi K3 모델 구동 테스트 결과를 공유합니다. llama.cpp 포크 버전과 GGUF 양자화 모델을 사용하여 예상보다 높은 성능을 확인했습니다.
핵심 포인트
- RTX 5090 2장 환경에서 약 4t/s의 디코딩 속도 달성
- 긴 프롬프트에 대한 프리필(Prefill) 속도는 50-70 tps 기록
- 시간이 지남에 따라 디코딩 속도가 증가하는 특이 현상 관찰
- llama.cpp 포크 버전 및 Kimi-K3-GGUF 양자화 모델 사용
768GB DDR5와 2x5090 환경에서 예상보다 더 좋은 결과를 얻었습니다. https://github.com/pwilkin/llama.cpp/tree/kimi-k3-text 포크 버전과 https://huggingface.co/GrEarl/Kimi-K3-GGUF Q2_K 양자화 (quant) 버전을 사용했습니다. 긴 프롬프트에 대한 프리필 (Prefill) 속도는 50-70 tps입니다. 가장 재미있는 점은 디코딩 (decoding) tps가 시간이 지남에 따라 증가한다는 것입니다. 아마도 일종의 웜업 (warmup)이나 스왑 (swap) 관련 기능인 것 같습니다. Llama-bench가 충돌하여 공유할 수 없습니다. submitted by /u/iVoider [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기