
Qwen3.8 27B IQ3_XXS (10.18GiB) 대 Bonsai Ternary PQ2 (6.42GiB) 테스트 결과
요약
본 테스트는 Qwen3.8의 양자화 모델(IQ3_XXS)과 Bonsai Ternary PQ2를 비교하며, 제한된 VRAM 환경에서 성능을 분석했습니다. 결과적으로 Qwen은 더 빠르고 적은 토큰을 사용했으며, 전반적인 효율성 면에서 우위를 보였습니다.
핵심 포인트
- Qwen IQ3 모델이 Bonsai 대비 3.02배 빠르며, 출력 토큰도 3.10배 적게 사용했습니다.
- 파일 크기가 작다고 무조건 좋은 것은 아니며, 성능과 속도를 종합적으로 고려해야 합니다.
- 테스트는 과학적이지 않으며, 같은 하드웨어에서의 UI 생성 작업 비교에 국한됩니다.
새롭게 화제가 된 Qwen3.8의 양자화(quantisation)와, 제한적인 16GB VRAM에 적절한 컨텍스트를 유지하며 들어가는 가장 큰 양자 모델을 비교하는 작은 테스트를 진행했습니다. 그 결과는 흥미롭습니다. 물론, 파일 크기가 더 작은 쪽이 성능은 떨어집니다. 하지만 그 차이가 그리 크지는 않습니다. 불행하게도, 이는 Bonsai 모델에서 훨씬 더 많은 토큰을 사용하고 따라서 생성 시간이 훨씬 길어진다는 단점이 있습니다. 시각적으로는 IQ3_XXS 결과가 더 마음에 들지만, 직접 확인해 보시기 바랍니다. 이 테스트는 결코 과학적이지 않으며, 같은 하드웨어에서 직접 비교하기 위한 몇 가지 UI 생성 작업에 불과합니다. 또한, 저는 Bonsai 모델이 MTP를 지원하지 않는 것 같아서 llama.cpp로 MTP를 실행했지만, 그 결과 더 느려졌습니다.
| Metric | Qwen IQ3 | Bonsai PQ2 |
|---|---|---|
| Tasks completed | 4/4 | 4/4 |
| Fixed assertions | 20/20 | 20/20 |
| Agent wall time | 8:00 | 24:09 |
| Output tokens | 27,197 | 84,176 |
| Weighted decode | 83.59 tok/s | 64.91 tok/s |
| Speculative acceptance | 65.22% | N/A |
| MTP | 39.76% | modified |
| N-gram Compactions | 0 | 0 |
| Length stops | 0 | 1 |
전체 테스트를 통틀어, Qwen은 3.02배 더 빠르고 3.10배 적은 출력 토큰을 사용했습니다.
결과: https://danmoreng.github.io/qwen3-8-27b-iq3-xxs-vs-bonsai/
Repo: https://github.com/Danmoreng/qwen3-8-27b-iq3-xxs-vs-bonsai
제출자: /u/Danmoreng [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기