Qwen3.8-Flash-Next-GSQ-RCO (IQ3_S) 성능 테스트 결과: 12GB VRAM 및 32GB RAM 환경에서 디코딩 속도와
요약
Qwen3.8-Flash-Next-GSQ-RCO 모델을 12GB VRAM 및 32GB RAM 환경에서 테스트한 결과, 높은 성능을 보여주었습니다. 특히 디코딩 속도는 20~30 tok/sec를 기록했으며, 131k 컨텍스트에서의 프리필 속도 역시 매우 빠릅니다. 이는 낮은 컴퓨팅 자원에서도 Opus와 유사한 경험을 제공할 수 있음을 시사합니다.
핵심 포인트
- Qwen3.8-Flash 모델의 성능 테스트 결과를 공유함.
- 12GB VRAM 및 32GB RAM 환경에서 높은 디코딩 속도를 달성함.
- 131k 컨텍스트 길이에서도 빠른 프리필 속도가 관찰됨.
- 낮은 자원에서도 Opus급 경험을 제공할 수 있는 잠재력을 보여줌.
저는 Qwen3.8-Flash-Next-GSQ-RCO-Abliterated를 IQ3_S로 구동했으며, 단지 12GB VRAM과 32GB 시스템 RAM만으로 2030 tok/sec의 디코딩 속도(Q2는 3945 tok/s 달성)와 131k 컨텍스트에서 300부터 약 90,000 tok/sec의 프리필 속도를 달성했습니다. 이 모델은 Strata의 커스텀 포크 버전입니다. 이 포크에는 엄청난 양의 아키텍처 변경 사항이 포함되어 있으며, 모두 매우 실험적이라서 아마도 작동하지 않을 수 있습니다. 하지만 성능이 이를 상쇄합니다. 이는 컴퓨팅 자원 2k 이하에서 로컬 Opus와 비슷한 느낌을 줍니다. https://github.com/bodhi37/Qwen3.8-Flash-12GBRAM-32GBVRAM-SSD-Recipe https://github.com/bodhi37/strata /u/bodhi371이 제출했습니다 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기