
16x GB10 클러스터에서 평균 20+tps로 실행되는 Kimi K3 풀 모델
요약
16x GB10 클러스터 환경에서 Kimi K3 풀 모델을 dspark를 통해 실행한 성능 결과입니다. 평균 20+ tps의 속도를 기록했으며, 향후 vLLM 이미지와 상세 사용 지침을 공유할 예정입니다.
핵심 포인트
- 16x GB10 클러스터에서 Kimi K3 모델 실행 성공
- 평균 20+ tps, 피크 시 38 tps의 추론 속도 달성
- 프리필(prefill) 단계에서 최대 750 tps 기록
- dspark를 활용한 첫 실행 사례 및 향후 vLLM 가이드 제공 예정
Kimi K3 풀 모델이 16x GB10 클러스터에서 평균 20+tps (llama-benchy coherent corpus 기준)로 실행 중이며, 피크(peak) 시 38tps, 프리필(prefill) 시 750tps를 기록하고 있습니다. 이것은 제 클러스터에서 dspark를 사용하여 K3 풀 모델을 처음으로 실행한 결과입니다. 몇 가지 테스트를 진행하여 속도를 높여볼 예정입니다. 준비가 되는 대로 vLLM 이미지와 사용 지침을 게시하겠습니다. https://forums.developer.nvidia.com/t/full-kimi-k3-running-on-16x-gb10-cluster/379174 /u/ciprianveg 에 의해 제출됨 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기