A100에서 실행되는 DeepSeek-V4-Flash-0731 Unsloth GGUF
요약
A100 GPU 환경에서 DeepSeek-V4-Flash-0731 모델을 Unsloth GGUF 형식으로 실행한 성능 결과입니다. VRAM 용량에 따라 전문가(experts) 배치 방식을 조절하여 최적의 추론 속도를 확보할 수 있습니다.
핵심 포인트
- A100 40GB 환경에서 Q8_K_XL 양자화 모델 실행 가능
- 전문가 배치 최적화를 통해 16.1~17.7 tok/s 속도 구현
- Codex를 활용한 에이전트 코딩 루프 구동 사례 확인
40GB VRAM을 탑재한 A100: 162GB Q8_K_XL ~16.1 tok/s 생성. 모든 전문가(experts)를 CPU에 배치했을 때 40GB VRAM 중 15.8GB만 사용됨. 참고: Linux 환경에서 코딩 테스트를 방금 마쳤음. DeepSeek-V4-Flash-0731은 6개의 전문가를 VRAM에 로드하여 단일 40GB A100에서 손실 없이 17.7 tok/s로 실행되며, Codex가 전체 에이전트 코딩 루프(agentic coding loop)를 구동함. /u/Different-Pickle1021이 r/LocalLLaMA에 게시함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기