Kimi-k3 실행 성공...
요약
Kimi-k3 모델을 llama.cpp 환경에서 실행한 벤치마크 결과입니다. 고사양 워크스테이션 환경에서 C++ 코딩 프롬프트를 처리하며, 향후 RPC 서버를 통한 클러스터 연결 계획을 포함하고 있습니다.
핵심 포인트
- Kimi-k3 모델의 llama.cpp 실행 및 성능 측정
- GGUF 변환 및 llama.cpp 최신 PR 적용
- RTX 6000 PRO 2장을 활용한 고사양 하드웨어 구성
- 향후 100GbE Fabric 기반 클러스터 확장 계획
결과: 프롬프트 평가 (prompt eval): 40 tokens / 97.5s → 0.41 tok/s, 평가 (eval): 400 tokens / 1769.9s → 0.23 tok/s, 총계 (total): 440 tokens / 1867s (31분)
프롬프트: "연결 리스트 (linked list)를 제자리에서 뒤집는 C++ 함수를 작성하세요. 포인터 조작 (pointer manipulation)에 대해 설명하세요."
실행 방법: llama.cpp GitHub의 PR#26185를 사용했습니다. GGUF로의 변환에도 동일한 PR을 사용했습니다.
하드웨어: 9965WX PRO, 512 GB DDR5 6400, RTX 6000 PRO 96GB x2, PCIE Gen 5 Raid NVME Raid card, Raid 0 구성의 2x 4TB 9100 Pros (~29 GB/s)
실행 정보:
기타 파라미터는 기본값이며, mmap은 켜져 있습니다 (기본값).
CUDA_VISIBLE_DEVICES=0,1 llama-server
-m k3-00001-of-00033.gguf
--n-cpu-moe 93 -ngl 99 -c 8192 -fa on --jinja
다음 단계: RPC 서버를 사용하여 2x 25GbE를 통해 100GbE Fabric (4xSpark Cluster)에 워크스테이션을 연결할 예정입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기