GGUF 기반 LoRA: 16G VRAM에서 Qwen3.6-35B-A3B 학습하기
요약
GGUF 포맷을 활용하여 16GB VRAM 환경에서 Qwen3.6-35B-A3B 모델을 LoRA로 학습하는 방법을 소개합니다. APEX 양자화와 전용 커널을 통해 CPU 오프로딩 없이 효율적인 학습이 가능함을 보여줍니다.
핵심 포인트
- GGUF를 활용한 저용량 VRAM 대상 LoRA 학습 가능
- APEX 양자화로 Qwen3.6-35B-A3B 모델 크기를 13.3 GiB로 축소
- fused dequant-matmul/MoE 커널을 통한 학습 효율 향상
- Strix Halo 및 RDNA3 GPU 환경에서 테스트 완료
- PyTorch 바인딩을 위한 torch-ggml-ops 라이브러리 제공
https://github.com/woct0rdho/transformers5-qwen3.5-recipe 이제 저용량 VRAM LoRA 학습을 위한 기본 모델 포맷으로서 bitsandbytes를 GGUF가 대체할 때가 되었습니다. GGUF는 MoE (Mixture of Experts), linear attentions, DeepSeek WTF attentions와 같은 새로운 모델 유형과 1-bit quants와 같은 새로운 양자화 (quant) 유형을 적극적으로 지원하고 있습니다. Qwen3.6-35B-A3B를 13.3 GiB 크기로 줄여주는 APEX quant 덕분에, 그리고 fused dequant-matmul/MoE 커널 덕분에, CPU 오프로딩 (offloading) 없이 16 GiB VRAM에서 배치 크기 (batch size) 1, 컨텍스트 청크 길이 (context chunk length) 2048, LoRA rank 4로 Qwen3.6-35B-A3B를 학습하는 것이 가능합니다. 저는 이를 Strix Halo에서 테스트했으며 6.5 s/it에 도달했습니다. 아마도 Strix Halo에서 VRAM 크기가 가장 큰 문제는 아니겠지만, RDNA3 GPU에서도 잘 작동할 것이며 다른 GPU로 포팅하는 것도 그리 어렵지 않을 것입니다. 그 부산물로 GGUF fused dequant-matmul/MoE 커널의 PyTorch 바인딩을 제공하는 https://github.com/woct0rdho/torch-ggml-ops 가 나왔습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기