GGUF 기반 LoRA: 90GiB VRAM으로 DeepSeek-V4-Flash 학습하기
요약
GGUF 기반 모델을 활용하여 90GiB VRAM 환경에서 DeepSeek-V4-Flash를 효율적으로 학습하는 기술적 업데이트를 소개합니다. Triton 커널 최적화를 통해 CPU 오프로딩 없이도 빠른 학습 속도를 구현했습니다.
핵심 포인트
- 90GiB VRAM에서 DeepSeek-V4-Flash LoRA 학습 가능
- Triton 커널 최적화로 CPU 오프로딩 없이 빠른 속도 구현
- GGUF 모델의 PyTorch 생태계 통합 및 모델 수술 용이성 확보
- Sliding attention, CSA, HCA 등 복잡한 메커니즘 지원
https://github.com/woct0rdho/transformers5-qwen3.5-recipe GGUF 베이스 모델을 활용한 저용량 VRAM LoRA 학습 진행 상황에 대한 업데이트입니다: 이제 CPU 오프로딩 (CPU offloading) 없이도 90 GiB VRAM에서 DeepSeek-V4-Flash (284B-A13B)를 학습할 수 있습니다. Strix Halo에서는 19 s/it의 속도로 실행됩니다. Sliding attention, CSA, HCA와 같은 모든 까다로운 부분들은 이제 vibe-coded Triton 커널을 갖추고 있으며, 이는 제가 본 그 어떤 구현체보다 빠릅니다. 학습 외에도, GGUF를 PyTorch 생태계에 통합하려는 작업이 Heretic와 같이 학습 이외의 모델 수술 (model surgeries)을 더 쉽게 만들 수 있기를 바랍니다. mHC를 이용한 Abliteration은 여전히 해결되지 않은 과제입니다. /u/woct0rdho가 제출한 https://huggingface.co/blog/RadicalNotionAI/mhc-ablation-challenges 를 참조하세요 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기