Strata - RTX 3090 - 128 Ram - Qwen 3.8 Flash Next
요약
사용자는 Strata를 DeepSeek 4.1 Flash의 도움으로 컴파일하여 테스트했으며, 기존 llama.cpp master 대비 압도적인 성능 향상을 경험했다고 보고했습니다. 특히 Unsloth의 UD-Q3_K_XL 양자화를 사용했을 때, Prompt 및 Generation 속도가 크게 개선되었으며 OpenCode 환경에서도 오류 없이 작동함을 확인했습니다.
핵심 포인트
- Strata는 llama.cpp master 대비 압도적인 처리 속도를 보여줍니다.
- Unsloth의 UD-Q3_K_XL 양자화가 정확성과 성능 면에서 우수합니다.
- OpenCode 환경에서 256k context와 도구 호출이 오류 없이 작동했습니다.
- 성능보다 정확성을 위해 사용자가 직접 양자화 방식을 제어하는 것이 중요합니다.
여러분, 저도 많은 분들처럼 Strata 게시물들을 보면서 매우 회의적이었습니다. 하지만 어제 DeepSeek 4.1 Flash의 도움을 받아 제 기기에 Strata를 컴파일해 봤는데, 솔직히 속도에 완전히 놀랐습니다.
llama.cpp master로는 최대 700 t/s PP와 23 t/s TG가 나왔습니다. 하지만 Unsloth의 UD-Q3_K_XL quant을 사용한 Strata는 컨텍스트에 따라 약 38~61 t/s TG를, 그리고 약 1,650 t/s PP를 기록했습니다. OpenCode에서 KV fp16 및 256k context로 모든 것이 문제없이 잘 작동했으며, 도구 호출 오류도 없었습니다. 정말 경이적이고, 부분적으로는 믿기 어려울 정도입니다.
저는 프로그래머가 아닙니다. 저는 그저 AI와 '감성적으로' 연결되는 사람입니다. 사람들은 Strata가 엉망이라고 말하지만, 실제로 그런지는 모르겠습니다. 하지만 저의 초기 경험은 정말 놀라웠습니다. 이제부터는 이것이 바로 AI입니다. 제가 이 데이터 요약과 Unsloth quant을 Strata에서 실행한 과정에 대해 물어보았습니다.
덧붙여서, Strata가 다운로드하고 추천하는 quant은 마음에 들지 않았습니다. 사소한 오류를 일으켰고 품질도 낮은 것 같았는데, 속도는 더 빨랐습니다. 제 사용 사례에서는 Unsloth의 것을 유지하는 것이 좋습니다. 조금 느리긴 하지만, 제 워크로드를 처리하기에는 더 정확합니다.
하드웨어 요약
GPU: NVIDIA RTX 3090, 24 GB (compute capability 8.6)
CPU: Intel i5-12600K (10 cores / 16 threads)
RAM: 128 GB DDR4 @ 3600 MT/s (XMP on)
Storage: 두 개의 NVMe SSD (시스템 + 모델)
전력 제한: 315 W (카드 최대 365 W)
CUDA: Toolkit 13.4; sm_86용 컴파일
Strata 통계 (Unsloth UD-Q3_K_XL)
| Metric | Strata | llama.cpp master |
|---|---|---|
| PP (prompt) | ~1,650 t/s (≈1,690 at 180k) | 최대 700 t/s |
| TG (generation) | 182k context에서 38 t/s; 짧은 컨텍스트에서 ~61 t/s | 23 t/s |
| Context / KV | 256k fp16 | 180k f16 |
| Expert cache hit | ~76% | n/a |
| Speculative (MTP) accept | ~76% | n/a |
| Tool calling | 오류 없음, OpenCode에서 작동 | n/a |
사용된 Quant: Unsloth UD-Q3_K_XL (동적 quant). Strata가 기본적으로 추천하는 quant은 아닙니다. 그 것이 더 빨랐지만 사소한 오류를 발생시켰고(주관적으로) 품질이 낮았습니다. 따라서 속도보다는 정확성을 위해 Unsloth의 것을 선택했습니다.
필요한 수정 사항 (양자화(quant) + Strata)
양자화(quant) 측면:
--compat-bf16을 포함하여 패킹됨 (일부 텐서가 BF16으로 읽히는 경우).
Strata 측면 (재컴파일/재구성):
MMQ를 사용하여 sm_86용으로 재구축함 (-DSTRATA_MMQ_KQUANTS=ON). 이로 인해 Q4 클래스 프롬프트 속도가 두 배가 됩니다.
설정에서 STRATA_PF_FUSED=0을 비활성화했습니다. 융합 커널(fused kernels)이 "down" 유형이 지원되지 않는 양자화된 전문가(quantized experts)에서 충돌했습니다 (잘못된 메모리 접근).
비전 인코더를 GPU로 이동시켰습니다: CUDA를 사용하여 strata-vision을 재컴파일했으며 (이전에는 CPU 전용), 모든 설정에 vision.gpu=true 및 --vram-reserve-mib 700을 설정했습니다.
모델별 보정(calibration) (--pcie-frac, --pool-workers, --spec-min-p) 및 전문가 캐시를 학습하고 영구 저장하기 위한 --expert-profile-save.
조정된 설정 (이 모델): 컨텍스트 256k, --kv fp16, --kv-resident 32768, 전문가 캐시 자동(auto) (6,517 슬롯 / ~14 GB), --spec 4, --pcie-frac 0.00, --pool-workers 9, --spec-min-p 0.70.
제출자: /u/cezarducatti
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기