Strata 엔진으로 구동한 Qwen3.8 Flash Next ISTA-DASLab GGUF 모델 성능 테스트 결과
요약
Strata 엔진을 사용하여 Qwen3.8 Flash Next ISTA-DASLab GGUF 모델의 성능 테스트 결과를 공유합니다. 이 추론 엔진은 기존 llama.cpp보다 월등히 빠른 속도를 보여, 43k 컨텍스트에서 초당 51 t/s를 기록했습니다. 특히 32k 컨텍스트 읽기 테스트에서는 초당 1500 t/s라는 매우 높은 성능을 달성하며 로컬 구동의 새로운 기준을 제시합니다.
핵심 포인트
- Strata 엔진은 기존 llama.cpp 대비 압도적인 추론 속도를 제공함.
- 32k 컨텍스트 읽기 테스트에서 초당 1500 t/s를 기록하는 등 높은 성능이 입증됨.
- Qwen3.8 Flash Next ISTA-DASLab GGUF 모델은 적은 VRAM으로 최첨단 모델 구동에 유리함.
- Strata는 특정 모델(ISTA-DASLab)에 특화되어 작동하며, Nvidia GPU에서 주로 사용 가능함.
저는 대부분의 사람들이 이 추론 엔진을 과소평가하고 있다고 생각합니다. 여러 llama.cpp 포크(fork)를 사용해 봤지만, 그 어떤 것도 Strata의 추론 속도에 근접하지 못했습니다. 초기 버전에는 kv 캐시(kv cache), CPU 스로틀링(CPU throttling)과 관련된 일부 버그가 있었으나 개발자가 이를 수정했습니다. 이 추론 엔진은 (현재 Nvidia에서만 작동하며 AMD 지원은 실험적입니다): https://github.com/Niko1221/Strata 여기에 스크린샷과 함께 몇 가지 측정 지표를 제시합니다. 제 노트북 사양은 5070ti 12GB VRAM, 64GB ddr5 RAM, Intel 275HX CPU, gen4 SSD입니다. 아쿠아리움 테스트 (unsloth studio가 로컬 API를 통해 연결됨) 제가 사용한 모델은 https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main/IQ3_XXS로, 크기에 비해 품질이 우수한 모델입니다. 위에서 이 모델을 이용해 아쿠아리움 테스트를 진행했습니다. 43k 컨텍스트 깊이(context depth)에서는 초당 51 t/s의 속도를 기록했습니다. 동일한 양자화(quant)를 사용했을 때, 순정 llama.cpp는 겨우 23t/s에 도달했습니다. 32k 컨텍스트 읽기 테스트에서는 (unsloth studio가 로컬 API를 통해 연결됨) 초당 1500t/s로 측정되었습니다. 이 양자화 모델은 동일한 양자화를 사용했을 때 순정 llama.cpp로는 최대 100t/s PP까지만 도달할 수 있었습니다. Strata는 32k 컨텍스트 텍스트를 초당 1500t/s로 읽어냈습니다. 이는 제가 기대했던 것보다 훨씬 높은 수치입니다. 이 양자화 모델은 최대 8bit에서 200k 컨텍스트까지 로드할 수 있습니다. 하지만 저는 131k 컨텍스트만 사용했습니다. 메모리 활용도 보시다시피, VRAM 11GB와 RAM 56GB를 사용하고 있습니다 (시스템/OS 프로그램 포함). 이 엔진은 특정 모델 하나만을 위해 특별히 구축되었으며, ISTA-DASLab의 선택된 gguf 파일들만 작동합니다. ISTA-DASLab에서 제공하는 IQ3_S는 코딩 벤치마크에서 전체 모델 성능을 복구한다고 주장하는 모델입니다. 저는 IQ3_XXS를 일정 시간 테스트해 봤는데, 매우 훌륭한 모델이라고 말씀드리고 싶습니다. 12GB VRAM만으로 6개월 전의 최첨단(frontier) 모델들을 노트북에서 로컬로 구동할 수 있을 것이라고는 생각지 못했습니다. 정말 살기 좋은 시대입니다! submitted by /u/MLDataScientist [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기