Radeon 6800H iGPU를 사용한 GLM-4.7 벤치마크 비교 (MXFP4 vs Q4_K_M vs Q4_K)
요약
AMD Radeon 6800H iGPU를 활용하여 deepseek2 30B MoE 모델의 다양한 양자화 버전을 비교 분석한 벤치마크 결과입니다. MXFP4 버전이 프롬프트 처리(PP) 속도에서 가장 빠르며, Q4_K_XL 버전은 토큰 생성(TG) 속도가 가장 뛰어난 등 각 양자화 방식별 최적 사용 사례를 제시합니다.
핵심 포인트
- MXFP4는 긴 컨텍스트/RAG에 유리하며 PP 처리 속도가 가장 높음 (258 t/s).
- Q4_K_XL은 빠른 응답 생성(TG)에 강점을 보이며 13.13 t/s를 기록함.
- 성능은 iGPU VRAM 부족으로 시스템 RAM 대역폭 및 지연 시간에 크게 의존함.
- 양자화 방식별로 PP와 TG 속도 간의 트레이드오프가 명확하게 나타남.
llama.cpp Ubuntu Vulkan 사전 빌드 바이너리와 AMD Ryzen 7 6800H가 탑재된 Acemagic miniPC S3A를 사용하여 테스트했습니다. 이 프로세서는 2022년 1월 4일에 출시된 고성능 8코어, 16스레드 모바일 프로세서로, 6nm Zen 3+ 아키텍처 기반이며 64GB의 DDR5 RAM이 장착되어 있습니다. 기본 클럭은 3.2 GHz, 부스트 클럭은 4.7 GHz이며, TDP는 45W이고 강력한 통합(iGPU) Radeon 680M 그래픽을 특징으로 합니다.
테스트 모델 (벤치마크 명령어 및 llama-bench 출력 레이블 기반):
- GLM-4.7-Flash-MXFP4_MOE.gguf (보고된 이름: deepseek2 30B.A3B MXFP4 MoE | 15.79 GiB)
- GLM-4.7-Flash-UD-Q4_K_XL.gguf (보고된 이름: deepseek2 30B.A3B Q4_K - Medium | 16.31 GiB)
- GLM-4.7-Flash-Q4_K_M.gguf (보고된 이름: deepseek2 30B.A3B Q4_K - Medium | 17.05 GiB)
참고: 파일명에는 GLM-4.7이 포함되어 있지만, llama-bench는 내부 GGUF 헤더를 읽어 deepseek2 30B.A3B로 보고합니다. 이 벤치마크 데이터는 약 30B 파라미터 MoE 아키텍처에 해당합니다.
평균 성능 결과
| 모델 파일명 | 보고된 이름 | 크기 | 평균 프롬프트 처리 (pp512) t/s | 평균 토큰 생성 (tg128) t/s |
|---|---|---|---|---|
| GLM-4.7-Flash-MXFP4_MOE.gguf | deepseek2 30B.A3B MXFP4 MoE | 15.79 GiB | 258.36 t/s | 11.66 t/s |
| GLM-4.7-Flash-Q4_K_M.gguf | deepseek2 30B.A3B Q4_K - Medium | 17.05 GiB | 218.22 t/s | 12.09 t/s |
| GLM-4.7-Flash-UD-Q4_K_XL.gguf | deepseek2 30B.A3B Q4_K - Medium | 16.31 GiB | 160.31 t/s | 13.13 t/s |
(값은 3회 실행의 산술 평균입니다. fa on = Flash Attention 활성화)
요약 분석
- 하드웨어 및 메모리 컨텍스트
- 장치: AMD Radeon Graphics (RADV REMBRANDT)
- 통합 GPU 아키텍처: UMA (Unified Memory Access)이며, fp16: 1 , bf16: 0 , fp4: 0 입니다.
- 시사점: 모델(약 16–17 GB)이 일반적인 iGPU VRAM을 초과하여 시스템 RAM으로 오프로딩됩니다. 성능은 시스템 메모리 대역폭(~50–65 GB/s DDR5) 및 PCIe/NB 링크 지연 시간에 크게 좌우됩니다. fp4: 0 플래그는 네이티브 FP4 컴퓨팅이 지원되지 않음을 확인시켜 주므로, MXFP4는 런타임에 에뮬레이션되거나 변환됩니다.
🔹 프롬프트 처리 (pp512) 대 생성 (tg128) 트레이드오프 형식
| PP 속도 | TG 속도 | 최적 사용 사례 | |
|---|---|---|---|
| MXFP4 MoE 🥇 | 가장 빠름 (258 t/s) 🥉 | 가장 느림 (11.66 t/s) | 긴 컨텍스트 창, RAG, 문서 처리 |
| Q4_K_M 🥈 | 균형 잡힘 (218 t/s) 🥈 | 균형 잡힘 (12.09 t/s) | 범용 채팅, 혼합 워크로드 |
| Q4_K_XL 🥔 | 가장 느림 (160 t/s) 🥇 | 가장 빠름 (13.13 t/s) | 빠른 응답 생성, 스트리밍 UI |
MXFP4가 PP에서 뛰어난 이유: 네이티브 FP4 지원은 부족하지만, MoE 구조와 극단적인 양자화는 어텐션 스코어링 중 활성 컴퓨팅 및 메모리 읽기를 크게 줄입니다. Flash Attention은 프롬프트 파싱을 위한 캐시 지역성을 추가로 최적화합니다.
Q4_K_XL이 TG에서 선두인 이유: 생성(Generation)은 순수하게 메모리 대역폭에 의해 제한됩니다. Q4_K_XL 양자화 레이아웃은 RADV 드라이버의 메모리 프리페칭에 더 잘 최적화된 것으로 보이며, Q4_K_M보다 약 13% 빠르고 MXFP4보다 약 12% 빠른 토큰 스트리밍 성능을 보여줍니다.
🔹 일관성 및 안정성
모든 실행에서 매우 낮은 표준 편차(TG의 경우 ±0.02–0.06 t/s)를 보여주어, 안정적인 열/전력 공급과 백그라운드 간섭이 없음을 나타냅니다. 예외: Q4_K_XL의 첫 번째 실행은 높은 PP 분산(±17.76 t/s)을 보였는데, 이는 콜드 캐시/메모리 할당 오버헤드 때문일 가능성이 높습니다. 이후 실행에서는 안정화되었습니다(±1.11 및 ±1.54), 이는 VM/페이지 캐시 워밍업의 일반적인 현상입니다.
🔹 권장 사항
- 채팅/스트리밍의 경우: Q4_K_XL을 사용하세요. 프롬프트 처리가 약간 느린 것은 일반적인 대화 턴에서는 무시할 수 있지만, 더 빠른 TG는 체감 지연 시간을 개선합니다.
- RAG/긴 컨텍스트의 경우: MXFP4_MOE를 사용하세요. 약 60%의 PP 속도 향상은 컨텍스트 로딩 대기 시간을 극적으로 줄여주며, 약간의 TG 영향은 배치 또는 일시 중지된 워크플로우에서는 허용할 수 있습니다.
제출자: /u/tabletuser_blogspot [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기