Strix Halo (gfx1151, ROCm) 기반 300B급 MoE 모델 두 개를 각각 128GB 미니 PC에 탑재한 엔진 Kyojin 공개
요약
Strix Halo (gfx1151, ROCm) 기반의 Kyojin 엔진을 공개하며, 300B급 MoE 모델 두 개(GLM-5.3-Flash, MiMo-V2.6-Flash-MOPD)를 각각 128GB 미니 PC에 탑재했습니다. 이 엔진은 ExLlamaV3를 기반으로 하며, 높은 추론 속도와 낮은 KLD 값을 보여줍니다.
핵심 포인트
- Strix Halo (gfx1151, ROCm) 환경에서 MoE 모델 구동 가능성을 입증함.
- Kyojin 엔진을 통해 300B급 대형 모델을 제한된 메모리 장치에 탑재 및 최적화함.
- GLM-5.3-Flash와 MiMo-V2.6-Flash-MOPD의 상세한 성능 지표를 제공하여 기술력을 과시함.
저희는 ExLlamaV3를 Strix Halo (gfx1151, ROCm) 위에 구축하여 Kyojin이라는 엔진을 만들었고, 300B급 MoE 모델 두 개를 패킹하여 각각의 128 GB 장치에 탑재했습니다. 첫 번째 버전이며, 모든 측정은 Ryzen AI Max+ 395에서 수행되었습니다.
| 모델 | GLM-5.3-Flash | MiMo-V2.6-Flash-MOPD |
|---|---|---|
| 크기 | 99.7 GB | 105 GB |
| Prefill | 3.5K에서 580 tok/s, 64K에서 546 at 64K, 4K에서 약 650 tok/s | - |
| Decode | (MTP) 26 ~ 30 tok/s | 32 prose / 35 chat / 44 code (speculative), 29 plain |
| KLD vs official FP8 | 0.151 | 0.0713 |
| Top-1 agreement with FP8 | 89.3 % | 92.0 % |
가중치 출처: MiMo는 자체 양자화(quantisation)를 거쳤습니다. GLM 패키지는 turboderp의 공개된 2.05 및 3.05 bpw EXL3 텐서에 저희 레이어 혼합과 작은 튜닝 단계를 결합한 것입니다. 같은 129개 행에서, 그의 2.05 bpw 패키지(85 GB)는 KLD가 0.275를 기록했지만, 저희의 혼합(100 GB)은 0.190을 기록했습니다. 그의 모델이 더 작고 디코딩 속도는 약 10% 빠릅니다.
비검열 변형 (Uncensored variants): 별도의 -Uncensored 저장소에서 제공되며, 동일한 가중치에 엔진 로드 시 적용되는 작은 파일 하나가 추가되고 스위치를 통해 비활성화할 수 있습니다.
아직 측정되지 않은 항목: gfx1151 이외의 GPU를 사용하고 128K 컨텍스트에서 MiMo와 GLM에 대한 Task-suite 점수입니다. 변환 파이프라인은 비공개로 유지됩니다.
빠른 시작 방법 (Quickstart): 클론 후, ./build.sh 실행, hf download yamz-labs/GLM-5.3-Flash-EXL3-Yamz, 그리고 python tools/glm/serve.py --model ./glm-pack -c 131072 --num-draft 2를 사용하면 OpenAI 스타일의 API를 얻을 수 있습니다.
모델: https://huggingface.co/yamz-labs
엔진: https://github.com/Yamz-Labs/kyojin
turboderp의 ExLlamaV3를 기반으로 하며, sdougbrown과 vcruz305가 ROCm 작업을 수행했습니다.
만약 Strix Halo 장치를 소유하고 계시다면, 여러분의 tok/s 측정을 공유해 주시면 감사하겠습니다. 이슈(Issues), 벤치마크 및 PR은 모두 환영합니다. 다음으로 어떤 모델을 작업할까요?
제출자: /u/Yaniss916
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기