
14B가 4B에게 패배했다——16GB GPU 한 장으로 측정한 증류(Distillation)의 용량-반응 기록
요약
RTX 5080 환경에서 다양한 규모의 LLM(1.7B~14B)을 대상으로 지식 증류(Distillation)의 용량-반응 실험을 수행한 연구 결과입니다. 실험 결과, 특정 규모(4B)에서 성능 정점이 나타나며 모델 크기가 반드시 성능 향상으로 이어지지 않는다는 점을 입증했습니다.
핵심 포인트
- 4B 모델이 실험 조건하에서 14B 모델보다 높은 성능 천장을 기록함
- 모델 규모에 따라 성능이 급격히 상승하는 상전이 지점이 존재함
- 모델 크기가 커질수록 근거 없는 정보를 생성하는 환각 위반율이 증가함
- 데이터 용량과 모델 규모 사이의 정규화된 S자 곡선(Master Curve) 발견
가정용 RTX 5080(16GB) 한 장으로, LLM 증류(Distillation)의 「용량-반응 시험(dose-response test)」을 수행했습니다.
4가지 학생 규모(Qwen3 1.7B/4B/8B/14B) × 11개의 학습 사례 수 = 44개 셀, 모든 셀 사전 등록,
평가 기준은 실험 전에 동결하였으며, 결과는 예측이 빗나간 사례를 포함하여 전부 공개합니다.
먼저 가장 중요한 헤드라인부터: 이 조건하에서는, 14B는 4B에게 패배했습니다.
무엇을 측정했는가
- 교사(큰 AI)가 만든 학습 사례를 「16개, 32개, … 192개」로 나누어 학생에게 증류하고,
각 셀에서 130개의 대본을 생성, 동결된 삼중 게이트(기능 ∧ 깊이 ∧ 무조작)로
합격률 Q를 측정 - 훈련 레시피(QLoRA r16 / lr 2e-4 / 2 에포크 / 시드 고정)는 모든 셀 공통
- 사전 등록은 Zenodo에 공개 완료. 결과 발표 전 동결한 6개의 수치 예측 성적:
4개 적중 · 1개 부분 오차 · 1개 보류(오차의 내용도 본문에 기재했습니다)
결과 1: 증류에는 「효과가 나타나기 시작하는 지점」이 있다
모든 규모에는 상전이점(phase transition point)이 있습니다. 1.7B와 4B는 64~96례 사이에서 갑자기 상승하며,
8B는 약 54례, 14B는 약 36례입니다. 용량은 필요 데이터량을 대체한다——가지고 있는 검증된
데이터가 48개뿐이라면, 14B만이 선택지입니다.
결과 2: 곡선은 단 하나뿐이다 (마스터 커브)
각 규모의 곡선을 「자신의 천장(ceiling)」과 「자신의 시작점(starting point)」으로 정규화하면, 4개가
하나의 S자 곡선으로 겹쳐집니다. 즉 Q(규모, 용량) ≈ 천장(규모) × S(용량/시작점(규모)).
규모가 돌리는 다이얼은 「시작점」과 「천장」 두 가지뿐입니다.
결과 3: 「클수록 좋다」는 깨진다
천장(플래토 평균)은 1.7B 42.8% → 4B 61.5% → 8B 53.1% → 14B 53.1%.
**정점은 4B입니다. 그보다 크게 만들어도 천장은 올라가지 않으며, 8B와 14B는 소수점 첫째 자리까지 동일한
「천장의 고원(plateau)」**이 되었습니다. 게다가 학생 모델이 클수록, 근거 목록에 없는 숫자를
멋대로 문장에 섞습니다 (위반 평균 0.31 → 0.40 → 0.43. 가장 유창한 규모가
가장 많이 혼입함).
VRAM 계급별 실무 요약
| 당신의 VRAM | 움직일 수 있는 왕자 | 처방전 |
|---|---|---|
| 8GB | 4B (=전체의 왕자) | 검증된 데이터를 96례 쌓은 후 훈련 |
| ... | ... | ... |
비용도 전부 기재합니다: 캠페인 GPU 전력은 실측 평균 95W, 전기 요금은
실측 3.94kWh · 약 122엔(로거 포착 41.7시간. 전체 56시간을 외삽해도 약 165엔).
장비 부품 리스트(전원 공급 장치 모델명까지)도 공개 리포지토리에 있습니다.
예측이 빗나간 이야기 (이 부분이 가장 중요합니다)
- 「14B의 플래토는 X 대역」이라는 단일 셀 예측은 틀렸습니다 (셀 간 변동 ±5pp에 비해
대역이 너무 좁았습니다). 플래토는 3개 셀 평균으로 다뤄야 한다는 측정론의 교훈과 함께 공개합니다. - 「용량 1단계 = 용량 1단계」라는 정수 교환설도 너무 거칠어서 절반은 틀렸습니다. 시작점은 매끄러운 감소 함수였습니다.
전부 검증할 수 있습니다
개별 데이터 5,720행(1 드래프트 = 1행, 삼문 판정 포함) · 전체 분석 스크립트 · 전력 로그를
DOI와 함께 공개하고 있습니다: https://doi.org/10.5281/zenodo.21730423
보존된 소재와 생성 문장은 평가 오염 방지를 위해 비공개(이유도 문서화 완료).
제 말을 믿지 않으셔도 됩니다. CSV를 다운로드하여 집계해 보시고, 틀렸다면 알려주세요.
틀린 점을 지적해 주시는 것이 가장 기쁜 반응입니다.
*이 시리즈의 방법론을 한 권으로 정리한 책이 있습니다: 『집 PC로 AI를 키운다.』 (Kindle ¥980)
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기