Qwen3.8-Flash-Next (IQ3_XXS, 76 GB)를 31 GB RAM에서 테스트한 결과: 프롬프트 1,800 tok/s, 디코드
요약
Qwen3.8-Flash-Next 모델을 RTX 5090과 RTX 4070 Ti SUPER 조합의 하드웨어에서 구동한 성능 테스트 결과입니다. 특히, 메모리 제약 환경(31GB RAM)에서도 높은 프롬프트 및 디코드 속도를 달성했습니다. 여러 최적화 패치와 기술적 분석을 통해 효율적인 모델 운영 방식을 제시합니다.
핵심 포인트
- 31GB RAM에서 Qwen3.8-Flash-Next를 구동하며 고속 성능 입증.
- 패치 적용으로 대화 내용 전환 시간이 20~48초에서 0.6~1.2초로 단축됨.
- 메모리 압박 시 주요 페이지 폴트(major page fault) 발생을 줄이는 기술적 개선이 핵심.
- 최종 설정에서 80K 프롬프트는 약 1,796 tok/s의 높은 속도를 기록함.
Qwen3.8-Flash-Next (IQ3_XXS, 76 GB) 모델을 전체 262K 컨텍스트 길이에서 31 GB RAM으로 구동한 결과: 프롬프트 속도 1,800 tok/s, 디코드 속도 130 tok/s를 달성했습니다. 사용된 하드웨어는 PCIe x1 슬롯에 장착된 RTX 5090 + RTX 4070 Ti SUPER 조합입니다.
Strata (github.com/Niko1221/Strata)는 mmap된 GGUF에서 MoE(Mixture of Experts) 전문가들을 스트리밍하며, 자체 크기 결정 규칙에 따르면 RAM은 '전문가 샤드 + 10 GB' 이상이어야 합니다. 따라서 ISTA GSQ-RCO IQ3_XXS의 경우 57 GB가 필요합니다. 저는 이 모델을 31 GB에서 구동했고 현재 매우 빠릅니다. 하드웨어 구성: RTX 5090 32 GB + RTX 4070 Ti SUPER 16 GB (작은 카드는 칩셋 x1 슬롯에 장착되어 대역폭이 0.8 GB/s입니다), i7-14700K, NVMe 스토리지 1개.
Stock 버전 0.1.33을 사용하고 레이어 분할(layer split)을 36으로 설정했을 때: 4070이 100%로 작동하고 5090은 유휴 상태인 상태에서 80K 토큰 프롬프트는 890 tok/s를 기록했습니다. 디코드 속도는 약 110 tok/s이며, 두 채팅 간 전환 시 다른 채팅 내용을 다시 읽어오는 시간이 발생합니다 (30K 토큰 = 48초 소요).
v0.1.33에 적용된 세 가지 패치(아래 리포지토리 참조, 깨끗한 체크아웃에 적용됨):
- 프롬프트는 전체가 큰 카드에서 실행되고, 작은 카드는 나중에 사용 중인 셀만 복사합니다. 이로 인해 대화 내용 보관(Conversation parking) 기능이 분할과 함께 작동하여, 휴대폰 세션과 데스크톱 세션을 번갈아 사용하는 시간이 20-48초 대신 0.6-1.2초로 단축되었습니다.
- RAM 용량이 전문가 파일 크기보다 적은 시스템에서 실제 병목 현상은 다음과 같습니다: mmap된 것에서 각 2 MB의 전문가를 memcpy를 통해 복사할 때 MADV_WILLNEED 힌트를 사용했습니다. 메모리 압박이 발생하면 커널이 이 리어헤드(readahead)를 제거하고, 4 KB당 주요 페이지 폴트(major page fault)가 발생하며, 이는 전문가 하나당 수백 번씩 일어나고 두 GPU 모두 대기하게 만듭니다. 대신 슬라이스별로 pread를 사용하자: 벤치마크 실행당 주요 폴트 횟수가 2,400만 회에서 14,000회로 줄었습니다.
- 더 큰 프롬프트 청크(--prefill auto:32768)를 사용했습니다. 모든 청크는 각 레이어의 전문가들을 다시 스트리밍하므로, 작업 집합(working set)이 페이지 캐시(page cache)에 맞지 않을 때 네 배 적은 청크가 큰 차이를 만듭니다.
최종 설정의 수치 (int8 KV, 레이어당 32K 셀 상주, MTP 사양 4, 비전 활성화, 262,144 컨텍스트):
- 신규 프롬프트 80K: 1,796 tok/s (45초); 16K: 985; 2K: ~350
- 80K 대화에서 후속 턴(follow-up turn): 6초
- 디코드: --spec-min-p 0.8 사용 시 실제 샘플링 기준 중앙값 128
134 tok/s (0.6 / 0.95 / 20), 95108은 그리디(greedy) - 40K 니들 + 후속 작업 및 두 개의 대화 주차 테스트 모두 정확함
- VRAM: 32.0 GB의 5090, 15.7 GB의 4070; RAM: 엔진 약 5 GB, 나머지는 페이지 캐시
패치, 설치 스크립트, 런처, 벤치마크 도구 및 모든 측정값이 포함된 저장소: https://github.com/ExTV/strata-5090-4070
제출자: /u/Fz1zz
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기