RTX 5070 12GB + 32GB RAM DDR4 환경에서 Qwen3.8-Flash-Next 177B 구동 성능 (11–15 tok/s)
요약
본 기사는 RTX 5070 12GB VRAM 환경에서 llama.cpp를 사용하여 Qwen3.8-Flash-Next 177B 모델을 구동한 성능 벤치마크 결과를 다룹니다. Windows 환경의 최적화와 '핫 전문가 계층' 구축 덕분에 기존 대비 높은 토큰 생성 속도(약 11–15 tok/s)를 달성했습니다.
핵심 포인트
- RTX 5070 12GB VRAM에서 Qwen3.8-Flash-Next 구동 성능을 측정함.
- Windows I/O 및 '핫 전문가 계층' 최적화가 주요 성능 향상 요인임.
- 일반 대화 환경에서 최대 14–15 tok/s의 속도를 확인했습니다.
여기서 LLM을 NVIDIA RTX 5070 12 GB VRAM으로 벤치마킹했습니다. Windows 환경에서 llama.cpp 기반의 Qwen3.8-Flash-Next 177B (UD-IQ3_XXS) 전문가 스트리밍 설정을 구축하는 작업을 진행해 왔습니다. 벤치마크 결과는 약 11.5 tok/s로, 기존 설정 대비 약 7 tok/s에서 향상되었습니다. 일반적인 대화에서는 14–15 tok/s를 확인했으며, 긴 코딩 프롬프트의 경우 4,892 토큰을 10.15 tok/s로 생성하여 작동하는 단일 파일 Snake 게임을 만들었습니다.
하드웨어 사양: RTX 5070 12GB, 32GB DDR4-2400, Ryzen 5 5600GT, PCIe Gen3, Windows
주요 성능 향상은 Windows I/O 큐 깊이(queue-depth) 문제를 수정하고, 워커당 파일 핸들(file handle)을 하나씩 사용하며, GPU가 '핫 전문가 가중치(hot expert weights)'를 더 효율적으로 가져올 수 있도록 페이지 잠금(page-locked)된 '핫 전문가 계층(hot-expert tier)'을 구축한 덕분이었습니다. (영상에서는 10k 토큰 생성에 약 16분이 소요되며, 10.41 tok/s입니다.)
출력은 제어 모델과 비교하여 품질이 검증되었으며, 게시된 벤치마크는 별도의 프롬프트 세트로 구축된 '핫 파일(heat file)'을 사용합니다.
데모:
GitHub에는 제가 시도했으나 작동하지 않은 것들과 벤치마크 스크립트, 그리고 방법론을 담았습니다. 혹시 스트리밍에 대한 제안이 있으시면 알려주세요.
제출자: /u/ayobluestarr (r/LocalLLaMA)
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기