Qwen 3.8 Flash Next q2_0을 2060 노트북(RAM 32GB + VRAM 6GB)에서 Strata를 사용하여 실행하기
요약
Qwen 3.8 Flash Next q2_0 모델을 구형 노트북(RAM 32GB, VRAM 6GB)에서 Strata를 사용하여 실행한 성능 테스트 결과입니다. 50k 컨텍스트에서 10 토큰/초의 디코드 속도가 매우 인상적이며, 특히 거의 100 토큰/초에 달하는 프리필 속도는 큰 프롬프트 처리 시 유용합니다.
핵심 포인트
- 구형 장비에서도 Qwen 모델 구동 가능성 입증
- 50k 컨텍스트에서 디코드 속도 10 토큰/초 기록
- 프리필 속도가 매우 빨라 대규모 프롬프트 처리에 유리함
좋습니다, 이 엔진은 정말 대단하네요. 저는 전체 Qwen 3.8 Next가 약 120B 파라미터(Engrams 제외)를 가지고 있기 때문에, 그리고 제가 단지 32 GB RAM만 가지고 있어서 SSD 스와핑으로 인해 작동이 느려질 것이라고 예상하며, 최대 프롬프트 처리 속도는 토큰/초당 30개, 디코드 속도는 토큰/초당 3개 정도가 될 거라고 생각했습니다.
하지만 50k 컨텍스트에서 10 토큰/초라는 속도는 이렇게 오래된 장치와 이렇게 큰 모델에 있어서 정말 놀랍습니다! 이 수치는 저를 매우 놀라게 했고, 제 의견으로는 매우 유용합니다.
4비트 kv cache를 사용했고 비전 기능은 없기 때문에 타협해야 할 부분이 있습니다. 하지만 솔직히 말해서, 프리필(prefill) 속도가 이것이 사용 가능하지 않은 것을 막아주는 유일한 요소입니다. 거의 100 토큰/초의 프리필 속도는 제가 예상했던 것보다 훨씬 높지만, 여전히 큰 프롬프트를 처리하는 데는 오랜 시간이 걸립니다. Qwen A35b A3B는 약 5배 더 빠른 프리필을 제공하며, kv cache를 양자화(quant)할 필요 없이 100K 컨텍스트를 사용할 수 있게 해줍니다. 따라서 그것의 완벽한 대체재는 아니지만, 더 많은 최적화가 나올지는 아무도 모릅니다?
어쨌든, 이것은 매우 인상적인 성능입니다. ./START-HERE.bat --draft-vocab en --vram-reserve-mib 100 --kv q4_0을 사용하여 실행했습니다.
이 엔진은 정말로 받는 관심에 걸맞습니다.
제출자: /u/dampflokfreund
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기