AMD R9700s를 위한 커스텀 Q8 튜닝 완료. 벤치마크 결과 12.5% 더 빠름
요약
AMD Radeon AI PRO R9700s 하드웨어에 최적화된 커스텀 Q8 양자화 튜닝 결과와 ROCmFPX 프로젝트를 소개합니다. gfx1201 디코드 튜닝을 통해 기존 업스트림 방식 대비 모델 크기를 줄이고 디코드 속도를 약 5.8% 향상시켰습니다.
핵심 포인트
- AMD R9700s(gfx1201) 전용 커스텀 Q8_0_ROCMFPX 양자화 구현
- 기존 Q8_0 대비 모델 크기 2.94% 감소 및 디코드 속도 약 5.8% 향상
- 정수 내적 방식을 사용하며 특정 ROCmFPX 포크 빌드가 필수적임
- NVIDIA 또는 타 AMD 카드에서는 작동하지 않는 하드웨어 특화 튜닝
저는 세 대의 Radeon AI PRO R9700s를 보유하고 있습니다. 단순히 일반적인 업스트림 (upstream) 형식을 사용하는 대신, 이 특정 하드웨어에 맞춘 양자화 (quant)를 튜닝할 수 있는지 알고 싶었습니다. 그러다 훌륭한 Carlo Pasquale가 만든 ROCmFPX GitHub 프로젝트를 발견하고 파고들기 시작했습니다. 제가 사용해 본 가장 빠른 변체는 MTP 버전입니다. 형식은 Q8_0_ROCMFPX입니다. 제가 담당한 부분은 gfx1201 디코드 (decode) 튜닝 - VDR8 벡터-내적 (vector-dot) 너비와 측정된 웨이브 정책 (wave policy) 및 모든 검증 (validation) 작업이었습니다. 각 블록 (blok)은 32개의 부호 있는 int8 코드와 하나의 UE4M3 스케일 (scale) 바이트를 저장합니다. 이는 네이티브 FP8이나 FP4가 아닙니다. 부동 소수점 누적 (float accumulation)을 사용하는 정수 내적 (integer dot products) 방식입니다. 모델은 HuggingFace에 올라와 있습니다: https://huggingface.co/1337Hero/Qwen3.6-27B-Q8_0-ROCMFPX-GGUF
수치들 - 좋았던 점과 나빴던 점:
- 모델 크기 vs 업스트림 Q8_0: 2.94% 더 작음
- HumanEval: 140/164 - 동일함
- 전체 모델 디코드 (Full-model decode): 5.77-5.87% 더 빠름
- 동일 작업, 18개 일치 쌍: 중앙값 5.82% 더 빠름, 17/18 쌍, p=0.000965
- 엔드 투 엔드 (End-to-end) 에이전트 실제 시간 (wall time): 2.21% 더 빠름 - 제가 원했던 3% 임계값(threshold) 달성 실패
- 동일한 패스 (Equal passes): 엔드 투 엔드 에이전트 지연 시간 (latency)은 달성하지 못함. 두 임계값은 실행 전에 고정되었습니다. 저는 통과한 것만 골라내고 있지 않습니다.
주의사항: 이것은 업스트림 llama.cpp, Ollama, LM Studio 또는 vLLM에서 실행되지 않습니다. 커스텀 텐서 (tensor) 타입을 사용하며 고정된(pinned) ROCmFPX 포크 (fork)가 필요합니다:
git clone https://github.com/1337hero/ROCmFPX.git
cd ROCmFPX
git checkout 45bcff509c4b1cff137e2cc1ea84671c61ceddea
env JOBS=16 scripts/build-r9700.sh
만약 gfx1201을 사용 중이고 소스에서 직접 빌드할 의향이 있다면, 한 번 시도해 보세요. NVIDIA를 사용 중이거나 다른 AMD 카드를 사용 중이라면, 아직 도움이 되지 않을 것입니다. gfx1201 튜닝이 핵심이기 때문입니다. 지금까지 X(구 트위터)에서 다른 두 명이 이를 확인해 주었습니다. 하지만 기본 Q8과 비교하여 벤치마크를 실행해 볼 다른 분들을 찾는다면 도움이 될 것입니다.
제가 '바이브 코딩(vibe coded)'으로 만든 결과물의 전체 과정을 보고 싶다면: https://github.com/1337hero/r9700-quant-lab
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기