GGUF 기반 LoRA: Qwen3.8-Flash-Next를 40GiB VRAM에서 학습시키기
요약
본 글은 GGUF 기반 LoRA를 활용하여 Qwen3.8-Flash-Next와 같은 대규모 모델을 40 GiB VRAM 환경에서 효율적으로 학습시키는 방법을 다룹니다. CPU 오프로딩 없이도 디스크 engram 사용 시 훈련 속도 저하가 없음을 보여주며, 특정 하드웨어(Strix Halo)에서의 성능 지표를 제시합니다.
핵심 포인트
- GGUF 기반 LoRA로 대규모 모델 학습 가능
- 40 GiB VRAM에서 Qwen3.8-Flash-Next 훈련 시연
- CPU 오프로딩 없이도 빠른 훈련 속도 유지
https://github.com/woct0rdho/transformers5-qwen3.5-recipe
LoRA over GGUF 시리즈에 대한 업데이트입니다. 이제 CPU 오프로딩 없이, 디스크의 engram을 사용하더라도 훈련 속도가 저하되지 않으면서 Qwen3.8-Flash-Next (125B-A6B + 51B engram)를 40 GiB VRAM에서 학습시킬 수 있게 되었습니다. Strix Halo에서는 컨텍스트 청크 크기 2048을 9.5 s/it에 훈련합니다. 이는 200 토큰/초입니다. 우리가 달성했던 > 1600 토큰/초의 PP와 비교했을 때 여전히 최적화할 여지가 있으며, LoRA 훈련이 PP 작업량의 2~3배가 걸린다는 일반적인 인식과도 차이가 있습니다. transformers 5.18 버전부터 현대 GGUF에 대한 초기 지원이 병합되었으며, 이 방향으로 더 많은 작업이 기대됩니다. 스포일러: torch-ggml-ops 리포지토리에는 GGTensile이라는 것이 있습니다. 기본적으로 MMQ 커널에 대한 Tensile과 유사한 asm 레벨 최적화입니다. 이미 여러 경우에서 HIP보다 빠르다는 것을 확인했습니다. 보여줄 것이 생기면 새로운 게시물을 작성할 생각입니다. 누군가 DeepSeek-V4.1을 125 GiB 미만으로 양자화하거나 가지치기를 할 수 없다면, 이 모델은 건너뛸 것 같습니다.
제출자: /u/woct0rdho [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기