
Gemma 4 26B-A4B와 12B에 DeepSeek를 증류(Distillation)하기: 별로 유용하진 않지만 많은 것을 배웠습니다.
요약
Gemma 4 26B-A4B 및 12B 모델에 DeepSeek 데이터를 사용하여 지식 증류(Distillation)를 수행한 실험 결과입니다. Dense 모델과 MoE 모델 간의 VRAM 소비, 학습 손실, 처리량 및 과적합 양상을 비교 분석했습니다.
핵심 포인트
- 26B MoE 모델이 12B Dense 모델보다 지식 흡수력이 뛰어나 학습 손실이 훨씬 낮음
- 12B 모델은 26B보다 학습 속도와 GPU당 처리량(Throughput) 측면에서 우수함
- MoE 모델은 Dense 모델 대비 약 2배의 VRAM을 점유함
- Unsloth Studio를 활용한 QLoRA 미세 조정 워크플로우 경험 공유
그래서 저는 LLM(대규모 언어 모델)을 미세 조정(Fine-tuning)하는 방법을 배우기로 결심했습니다. Unsloth의 가이드 몇 개를 읽고 이것저것 살펴보다가, Unsloth Studio를 우연히 발견하여 테스트해보고 싶었습니다. 제가 시작한 데이터셋은 상대적으로 관련이 없는 QA 쌍인 Natural Questions 세트였으며, 여기서 답변을 제거했습니다. 그런 다음 DeepSeek v4 Pro(thinking disabled)를 사용하여 답변을 다시 채웠습니다: - 훈련(train) 1000개 + 검증(val) 200개 = 총 1200개 요청, 비용 $0.36 (요청당 약 $0.0003). 솔직히 DeepSeek 측면에서 매우 인상적이었습니다. Unsloth Studio는 사용하기 매우 번거로웠습니다. 쉽게 사용할 수 없게 만드는 온갖 종류의 버그들이 가득했습니다. 워크플로우를 파악하고 나면 작업은 가능했지만, 디버깅(Debug)을 예상해야 합니다. 그 후 서버를 대여했습니다: 2x RTX 3090, 128GB RAM, Threadripper. 제가 훈련한 것: 훈련 중 Dense 모델과 MoE(Mixture of Experts)를 비교하기 위해 두 모델을 학습시켰습니다: - gemma-4-26B-A4B-it-qat는 두 개의 GPU를 모두 사용 - gemma-4-12B-it-qat는 하나의 GPU를 사용 둘 다 QLoRA, 4-bit, 동일한 하이퍼파라미터(Hyperparams)를 사용했습니다. (첨부된 이미지 참조) 흥미로운 점들: 26B는 12B보다 약 2배의 VRAM을 소비했습니다 (28.6GB vs 14.3GB) — 이는 MoE의 점유 면적(Footprint)과 일치합니다. 두 베이스 모델(Base models) 모두 벤치마크에서 거의 동일한 점수를 기록했지만, 26B가 훨씬 더 많은 내부 지식을 가지고 있어 증류(Distillation)를 훨씬 더 강력하게 흡수할 수 있었습니다: 훈련 손실(Train loss)이 약 4배 더 낮게 바닥을 찍었습니다 (0.18 vs 0.71). 하지만 검증(Eval) 격차는 작았습니다 (1.12 vs 1.20). 제가 12B를 과적합(Overfit)시킨 것 같습니다: 검증 점수는 125~150 스텝 부근에서 약 1.18로 정체되었다가, 250 스텝까지 다시 1.20으로 올라갔습니다. Dense 12B 모델은 26B가 두 개의 GPU를 사용했음에도 불구하고, 실제 시간(Wall-clock) 측면에서 더 빨랐고 (54분 vs 72분) GPU당 처리량(Throughput)도 더 높았습니다 (345 vs 261 tok/s). 12B의 그래디언트 노름(Grad norm)은 약 5.4배 더 노이즈가 심했습니다 (1.94 vs 0.36). 비용: DeepSeek 증류 $0.36 · 서버 $3.38. 모든 하이퍼파라미터, 훈련/검증 손실 곡선, 그래디언트 노름, LR 스케줄(LR schedule), 그리고 소요 시간을 정리한 대시보드 이미지를 첨부했습니다. 모델 (GGUF): 1. https://huggingface.co/gwejgteheg/gemma-4-26B-A4B-it-qat-DeepSeek-distill-GGUF 2.
https://huggingface.co/gwejgteheg/gemma-4-12B-IT-QAT-Q4_K_M-DeepSeek-distill-GGUF
데이터셋 (재현성용): - https://huggingface.co/datasets/gwejgteheg/natural_questions_pair/tree/main
어떠한 피드백도 환영하며, 궁금한 점이 있다면 언제든 편하게 질문해 주세요. 또한, 현재 커뮤니티에서 어떤 종류의 미세 조정 (Fine-tunes)이 필요하신가요?
/u/Paramecium_caudatum_ 가 r/LocalLLaMA 에 게시함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기