
Dual 3060 및 96GB RAM 환경에서의 DeepSeek V4 Flash 0731 IQ2_M 벤치마크 ≈ 3.5 tok/s
요약
Dual RTX 3060과 96GB RAM 환경에서 Unsloth Studio를 사용하여 DeepSeek V4 Flash 모델을 실행한 벤치마크 결과입니다. RAM 오프로딩을 활용하여 약 3.5 tok/s의 속도를 기록했으며, 저전력 환경에서의 구동 성능을 확인했습니다.
핵심 포인트
- Unsloth Studio를 통한 멀티 GPU 가중치 로드 성공
- Dual RTX 3060 및 RAM 오프로딩 활용 시 약 3.5 tok/s 성능
- 언더볼팅을 통해 GPU당 30-40W 수준의 저전력 구동 가능
- 대용량 RAM(96GB)을 활용한 모델 실행 환경 구축
커뮤니티의 도움 덕분에 마침내 이 LLM을 실행했습니다. LM Studio는 두 번째 GPU로 가중치(weight)를 로드하는 것을 거부했지만, Unsloth Studio는 이를 수행하여 모든 작업이 그 안에서 완료되었습니다. 제대로 된 벤치마크는 아니지만(PC를 병렬로 사용함), RAM 오프로딩(offloading)을 사용하는 Dual 3060의 성능에 대한 아이디어를 제공합니다. Unsloth의 DeepSeek V4 Flash 0731 IQ2_M
CPU: Ryzen 7500F
GPU 0 (PCIe 5.0x16 lane): RTX3060
GPU 1 (PCIe 3.0x1 lane): RTX3060
RAM: 96GB 5600
Prompt: Write me a tetris game.
Result (요약에서 복사):
Prompt eval: 2.96s
Prompt speed: 3.0 tok/s
Generation: 960.02s
Speed: 4.5 tok/s (PowerShell은 3.5 tok/s로 표시하는데, 왜 4.5 tok/s로 표시되는지 모르겠습니다. RAM 오프로딩을 사용한 단일 GPU 출력은 약 3 tok/s였으므로 PowerShell 지표를 더 신뢰합니다)
Tokens: 4,338
First token: 2.96s
Cache hits: 1
Total: 963.32s
Chunks: 4318
전력계(Wattmeter)가 오는 중이지만, 제 추정치는 총 시스템 전력 소모량이 약 130W입니다 (모니터 2개가 연결되어 있지만 이는 고려되지 않았습니다). 각 GPU는 0.9V 언더볼팅(undervolt)을 통해 30-40W를 사용했습니다. 작업 완료에는 약 16분이 소요되었고, 약 35와트를 소비했으며 비용은 0.0059 유로가 들었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기