
DeepSeek v4 Flash 0731 GGUF 벤치마크: TensorSharp vs. llama.cpp
요약
오픈 소스 추론 엔진인 TensorSharp가 DeepSeek v4 Flash GGUF 모델을 지원하며, llama.cpp 대비 우수한 성능을 기록했습니다. 4x Nvidia A40 환경에서 TensorSharp의 CUDA 백엔드가 더 높은 prefill 및 decode 속도를 보여줍니다.
핵심 포인트
- TensorSharp의 DeepSeek v4 Flash 모델 지원 업데이트
- llama.cpp 대비 우수한 prefill 및 decode 성능 확인
- CUDA, Vulkan, Metal 등 다양한 백엔드 및 멀티 GPU 지원
- 연속 배치 및 투기적 디코딩 등 고급 추론 기능 포함
TensorSharp는 CUDA, Vulkan, Metal, OpenAI 호환 API, 연속 배치 (continuous batching), 투기적 디코딩 (speculative decoding) 및 멀티모달 (multimodal) 지원을 갖춘 GGUF LLM을 로컬에서 실행하기 위한 오픈 소스 추론 엔진 (inference engine)입니다. 최근 오픈 소스 커뮤니티의 기여 덕분에 TensorSharp는 여러 개의 GPU 및 노드에서 추론을 실행할 수 있게 되었습니다. 그래서 저는 DeepSeek v4 Flash 모델을 지원하도록 업데이트했으며, llama.cpp보다 더 나은 성능을 보여줍니다. 다음은 4x Nvidia A40 GPU, CUDA 12.8 환경에서의 벤치마크 결과입니다.
모델: https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF 에서 가져온 DeepSeek-V4-Flash-0731-UD-Q8_K_XL
| 구분 | TensorSharp (CUDA 백엔드) | TensorSharp (ggml_cuda 백엔드) | llama.cpp |
|---|---|---|---|
| prefill u/16K | 836 tok/s | 963 | 558 |
| decode short | 31.5 | 37.0 | 35.3 |
| decode u/16K | 28.5 | 33.6 | 32.2 |
확인해 주시고 프로젝트에 별(star)을 눌러주셔서 감사합니다! 어떤 피드백이든 정말 환영합니다.
submitted by /u/fuzhongkai [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기