Qwen3.8-Flash-Next (125B)를 단일 Strix Halo mini PC에서 구동한 결과: 추측 디코딩 사용 시 44~59
요약
AMD Strix Halo mini PC에서 Qwen3.8-Flash-Next (125B MoE) 모델을 구동한 결과를 공유합니다. 새로운 추론 엔진 Kyojin과 95GB EXL3 가중치를 통해, 이 미니 PC 환경에서도 높은 속도와 긴 컨텍스트 처리 능력을 입증했습니다. 특히 추측 디코딩 사용 시 코드 작업에서 58 tok/s를 기록하는 등 강력한 성능을 보여주었습니다.
핵심 포인트
- Strix Halo mini PC에서 Qwen3.8-Flash-Next (125B) 구동 성공.
- 추론 엔진 Kyojin과 EXL3 가중치를 공개하여 오픈 소스로 배포함.
- 추측 디코딩 사용 시 코드 작업에서 58 tok/s의 성능을 기록함.
- 원본 모델 대비 높은 충실도(94.1% top-1 일치율)를 유지함.
안녕하세요. 지난 몇 주 동안 AMD Strix Halo 박스(Ryzen AI Max+ 395, 128 GB) 한 대에서 Qwen3.8-Flash-Next (125B MoE, 6B active)를 제대로 구동하는 데 매달렸습니다. 오늘 밤에는 95 GB EXL3 가중치와 저희 추론 엔진인 Kyojin의 새로운 버전을 공개합니다(ExLlamaV3 기반으로 구축되었으며 오픈 소스입니다).
이것은 첫 번째 버전이며, GLM-5.3-Flash 및 MiMo-V2.6-Flash 빌드와 동일합니다. 저희는 이를 먼저 배포하고 오픈 소스로 개선하는 것을 선호합니다: 속도 및 품질 업데이트가 세 가지 모두에 곧 제공될 예정입니다.
미니 PC에서 새로 클론하고 구축한 모든 수치들입니다:
디코드(Decode): 작업 유형에 따라 추측 디코딩을 사용했을 때 44~59 tok/s를 기록했습니다 (채팅 ~47, 코드 ~58, 복사-중심 편집 ~60). 추측 디코딩 없이는 32.7 tok/s입니다.
프리필(Prefill): 4K에서 1,412 tok/s, 32K에서 1,486 tok/s, 128K에서 1,367 tok/s를 기록했습니다 (서버 보고 수치). 거의 평평하게 유지됩니다.
긴 컨텍스트(Long context): 64K와 128K 모두에서 10/10의 니들 테스트를 통과했으며, 128K에서도 여전히 32 tok/s입니다.
충실도(Fidelity): 844개 위치에 걸쳐 원본 FP8 모델 대비 top-1 일치율이 94.1%입니다.
저희가 좀 고집하는 한 가지는, 여기서의 추측 디코딩은 일반적인 디코딩과 정확히 동일한 토큰을 반환한다는 것입니다. 저희는 모든 릴리스에서 이를 확인합니다.
비교를 위해, llama.cpp 사용자가 이 같은 미니 PC(Vulkan, UD-IQ4_XS)에서 추측 기능을 사용하여 약 30 tok/s, 프리필은 약 500 tok/s를 게시했습니다. 이는 그들의 수치이며 저희가 측정한 것이 아닙니다: https://github.com/ggml-org/llama.cpp/discussions/28512
이제 우리가 최고가 아닌 부분입니다. Halogen 0.16.2 (v2 체크포인트)는 저희보다 빠릅니다: 일반 디코딩 시 39.8 vs 32.7 tok/s, 추측 사용 채팅 시 52 vs 47 tok/s, 그리고 클라이언트에서 동일하게 측정한 프리필의 경우 10~20% 앞섭니다 (4K에서 1,306 vs 약 1,460, 16K에서 1,394 vs 약 1,720). 코드 작업에서는 근접합니다 (중앙 통과 기준 58.5 vs 51.2로, 워밍업 후 그들이 앞섭니다). 저희가 더 나은 점은 원본 모델에 대한 충실도입니다: 상대방이 92.3%인 것에 비해 94.1%의 top-1 일치율을 보이며, KL 다이버전스는 저희 쪽에서 41% 낮습니다. 전체 표는 모델 카드에 있습니다.
속도 격차를 줄이는 것이 다음 목표입니다. 저희는 엔진의 핵심을 개편할 예정이며, 이는 이 모델뿐만 아니라 구동하는 모든 모델에 도움이 될 것입니다. 하드웨어에는 여전히 여유 공간이 있습니다.
또한 기본적으로 비활성화된 선택적(optional) 비검열(uncensor) 프리셋이 있습니다 (100개의 유해 프롬프트 중 4회 거부, 기존 대비 99회 감소, 벤치마크는 노이즈 범위 내). 만약 에이전트가 도구 호출(tool calls)에 크게 의존한다면 이 기능을 꺼두세요.
가중치(Weights): https://huggingface.co/yamz-labs/Qwen3.8-Flash-Next-EXL3-Yamz
엔진(Engine): https://github.com/Yamz-Labs/kyojin
만약 사용해 보신다면, 토큰/초(tok/s)와 하드웨어 정보를 공유해 주시면 감사하겠습니다. 그리고 다음에 어떤 기능을 보고 싶은지 알려주세요.
제출자: /u/Yaniss916
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기