
단일 RTX 3090에서 실행되는 Döner Bench DeepSeek-V4-Flash IQ2_XS
요약
RTX 3090 환경에서 DeepSeek-V4-Flash 모델을 IQ2_XS 양자화 버전으로 실행한 벤치마크 결과입니다. 극도로 낮은 비트의 양자화 상태에서도 HTML/JS를 이용한 복잡한 애니메이션 시뮬레이션 코드를 성공적으로 생성함을 확인했습니다.
핵심 포인트
- RTX 3090(24GB VRAM) 환경에서 DeepSeek-V4-Flash 실행
- IQ2_XS 초저비트 양자화 모델의 코드 생성 능력 검증
- 복잡한 애니메이션이 포함된 단일 HTML 파일 생성 성공
- 양자화로 인한 디테일 저하는 있으나 전체 컨셉 유지 확인
https://preview.redd.it/3zcvpbds14hh1.png?width=1911&format=png&auto=webp&s=a79aafb71eeca97638da93d2591902631e897fd5 최근의 모델 양자화 (model-quant) 비교와 유사한 테스트를 시도해 보았으나, 이번에는 다음 사항에만 집중했습니다: DeepSeek-V4-Flash-0731-IQ2_XS-Experts-Q8_0 모델 링크 bullerwins/DeepSeek-V4-Flash-0731-GGUF · Hugging Face 하드웨어 RTX 3090 24 GB 128 GB DDR4 RAM Windows llama.cpp / llama-server 프롬프트(Prompt) 전체 페이지 캔버스와 라이브러리가 없는 단일 HTML 파일을 작성하세요. 가스 가열 요소 앞에서 수직으로 회전하는 현실적인 도너(Döner) 스타일의 케밥 꼬치를 시뮬레이션하세요. 결과물 렌더링은 첨부된 이미지에 표시되어 있습니다. 모델의 대부분이 IQ2_XS로 양자화(quantized)되었다는 점을 고려할 때, 완전하고 작동 가능한 결과를 생성했다는 점이 인상적이었습니다. 분명 완벽하지는 않으며 일부 미세한 디테일과 현실감이 떨어지지만, 전체적인 장면, 애니메이션 및 요청된 컨셉은 여전히 유지되고 있습니다. https://pastebin.com/h1VE5aj0 사용된 명령어(Command) "D:\cpp\llama-server.exe" ^ -m "E:\models\DeepSeek-V4-Flash-0731-IQ2_XS-Experts-Q8_0\DeepSeek-V4-Flash-0731-IQ2_XS-Experts-Q8_0.gguf" ^ --fit on ^ --fit-ctx 32768 ^ --fit-target 1024 ^ --jinja --metrics --perf ^ -np 1 ^ -ub 4096 -b 4096 ^ --no-kv-unified ^ --no-mmap ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --temp 1.0 --top_k 40 --top_p 1.0 ^ --min-p 0.00 --repeat-penalty 1.0 --presence-penalty 0.0 ^ --threads 14 /u/nikhilprasanth 제출 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기