vLLM 환경에서 단일 R9700 (gfx1201)으로 Qwen3.6 27B + 35B 구동
요약
Radeon AI Pro R9700 단일 GPU 환경에서 vLLM을 사용하여 Qwen3.6 27B 및 35B 모델 구동 결과를 공유합니다. INT4 양자화와 최적 설정을 통해 대용량 컨텍스트 길이(최대 150k)에서도 높은 추론 성능을 유지할 수 있음을 보여줍니다.
핵심 포인트
- 단일 R9700 환경에서 vLLM으로 Qwen3.6 27B/35B 구동 가능.
- INT4 양자화와 최적 설정으로 대용량 컨텍스트 처리 효율성 입증.
- 모델별(Dense vs MoE) 특성에 따른 성능 및 메모리 사용 차이 분석.
새로운 Radeon AI Pro R9700을 튜닝해 왔으며, 자신의 설정을 최적화하려는 분들에게 이 정보가 유용할 것이라고 생각했습니다. 저는 이 결과에 상당히 만족하며 Qwen3.8을 기대하고 있습니다.. 아래 요약은 Claude가 제공했습니다 (Claude는 제가 podman을 통해 시스템에서 실행할 수 있도록 설정을 도와주었습니다).
설정: stilldeadcode/vllm-radiance:0.5.8. 단일(dual 아님) 카드. https://hub.docker.com/r/stilldeadcode/vllm-radiance/ https://codeberg.org/StillDeadcode/vllm-radiance/
이미지에 포함된 참조 설정(reference config)은 2× R9700 (TP=2) 환경의 FP8 가중치(weights)에 맞춰 튜닝되어 있습니다. 대부분의 기본값(AITER attention backend, FP8 KV, --no-async-scheduling, --mamba-cache-mode align, 모든 RADIANCE_* 토글)은 그대로 사용해도 정확하며 수정할 필요가 없습니다.
INT4로 단일 카드를 실행할 때 실제로 달라지는 부분은 다음과 같습니다:
참조 대비 설정 차이:
--tensor-parallel-size 1 (두 번째 카드 없음)
--gpu-memory-utilization 0.98 (참조 범위는 듀얼 카드에서 0.90–0.97)
27B 모델에서 num_speculative_tokens=4 설정.
컨테이너를 대상으로 직접 Ladder 테스트를 수행했습니다 (2/3/4/8 단계; 4 arms × 2 loads × 2 reps × 4 depths). 모든 깊이에서 4가 8보다 17–48% 더 우수한 성능을 보였습니다.
모델 가중치 (Model Weights): https://huggingface.co/Avesed
가중치: Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). 35B 모델을 FP8로 사용할 경우, 유용한 컨텍스트 길이(context length)를 확보하면서 32GB 단일 카드에 담는 것이 불가능합니다.
체크포인트 수정 사항 (이미지 문제는 아님): Avesed INT4 저장소의 tokenizer.json에 truncation.max_length: 512 / padding: Fixed(512)가 캘리브레이션(calibration) 과정에서 포함되어 있습니다. 이로 인해 약 672px 이상의 비전(vision) 기능이 작동하지 않습니다. 두 값을 모두 null로 설정하세요.
모델 참고 사항:
27B: Dense (MoE 아님), MTP 켬, num_speculative_tokens=4, 131,072 ctx.
35B: MoE (A3B), MTP 끔, 262,144 ctx.
벤치마크 결과
35B-A3B MoE (KV pool tokens = 440,241)
Depth Prefill tok/s Decode tok/s
4k ~7,800 61.4
16k ~7,700 60.1
50k ~6,040 57.0
78k ~5,120 54.7
100k ~4,580 52.9
150k ~3,690 49.5
27B dense, MTP spec=4 (KV pool tokens = 212,147)
Depth Prefill tok/s Decode tok/s
Mean accepted len
4k ~1,288 59.6 4.4
16k ~1,345 62.3 4.6
50k ~1,207 59.6 4.5
100k ~1,027 53.7 4.5
더 필요한 세부 정보나 시작 스크립트가 필요하면 제공해 드릴 수 있습니다. submitted by /u/KriptacMessage [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기