DeepSeek V4 Flash 0731 - Happy Numbers (700pp/18tg) 및 고찰
요약
DeepSeek-V4-Flash 모델을 llama.cpp 환경에서 최적화하여 구동한 성능 테스트 결과입니다. 특정 설정(--cpu-moe)을 통해 높은 처리 속도를 달성했으나, FP8 캐시 미지원 및 배치 크기 제한 등의 기술적 한계와 하드웨어 구성 방안을 다룹니다.
핵심 포인트
- --cpu-moe 설정을 통해 700pp/s 및 18tg/s의 높은 성능 달성
- llama.cpp의 DeepSeek-V4 Flash 네이티브 FP8 캐시 미지원 확인
- 배치 크기 증가 시 --cpu-moe 사용 시 실행 중단 문제 발생
- 고성능 추론 시스템 구축을 위한 가성비 하드웨어(Epyc, DDR4 ECC) 제안
원래는 약 140pp/s와 약 21tg/s 정도를 얻었으나, -b 8192 -ub 8192 --cpu-moe 설정을 사용한 것이 훨씬 우수하며, 가장 관련성 높은 범위에서 700pp/s 및 18tg/s 정도라고 할 수 있습니다. 테스트 시스템: CPU: Threadripper 5965WX (24c/48t) RAM: 512GB ( 8 x64 DDR4 ECC REG 2400 ) GPU: RTX 5090 (PCIe 4 x16, 450W) 실행 명령어: ./build/bin/llama-server \ -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL \ --temp 1.0 --top-p 1.0 --min-p 0.0 --host 0.0.0.0 \ --ctx-size 262144 --no-mmap -b 8192 -ub 8192 \ --cpu-moe 결과: PP/s는 주어진 프롬프트 길이까지의 평균이며, 생성은 해당 깊이에서 이루어집니다. 첫 번째 실행(~20k)은 콜드 스타트(cold-start)였습니다.
Prompt Tokens PP/s TG/s
19970 712.76 18.81
36044 724.37 18.65
101204 648.85 17.88
저는 llama.cpp 전문가가 아니므로 아마 더 잘할 수도 있겠지만, 배치(batch)를 16k로 올리면 --cpu-moe 사용 시 실행이 중단되고, 사용하지 않으면 생성이 약 7tg/s로 급감합니다. 개선의 여지가 있다고 생각합니다. llama.cpp가 DeepSeek-V4 Flash의 네이티브 FP8 캐시(cache)를 지원하지 않는다는 것을 발견했으므로, FP16 캐시를 위해서는 두 배의 용량이 필요합니다. 또한, 스펙큘레이터(speculator)가 작동하지 않는 것 같기도 합니다? 어쩌면 이 시스템을 구축할 가치가 있을까요? DDR4 ECC REG (2133/2400과 같은 느린 제품, 32GB DIMM)는 1GB당 약 1달러에 찾을 수 있습니다 (LGA2011-v3 서버 전체를 구매해야 할 수도 있습니다). Aliexpress의 SP3 보드는 약 350달러, 괜찮은 Epyc 7002/7003 CPU는 250달러에서 500달러 정도입니다. 따라서 기본 시스템에 약 1,000달러가 들고, 그다음은 32gb-48gb VRAM을 확보하는 것이 관건이겠네요 ;) 아마 5060 Ti 2개가 해결책이 될까요?
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기