며칠 전, 저희는 DynamicTune의 아이디어를 공유했습니다
요약
저희는 DynamicTune이라는 새로운 방법을 제안했습니다. 이는 대형 교사 모델의 추론 흐름을 폐쇄형 선형 대수학으로 추출하여 소형 학생 모델에 직접 전달하는 방식입니다. 이 방법은 백프로파게이션이나 학습 토큰 없이도 0.8B 모델이 2B 모델보다 높은 성능(42.15% vs 41.10%)을 달성하며, 소비자 하드웨어에서도 빠르게 구동 가능함을 입증했습니다.
핵심 포인트
- DynamicTune은 백프로파게이션/학습 없이 대형 모델의 지식을 소형 모델에 전달합니다.
- 0.8B DynamicTune 모델이 2B 기본 모델보다 높은 성능을 보여 LLM 스케일링 패러다임을 바꿉니다.
- 소비자 하드웨어에서 약 12분 만에 구현 가능하며, 데이터센터 환경에서도 검증되었습니다.
며칠 전, 저희는 DynamicTune의 아이디어를 공유했습니다. 이는 더 큰 교사(teacher) 모델의 궤적 흐름을 폐쇄형 선형 대수학을 통해 작은 학생(student)에게 직접 전달하는 방식으로, 일반 소비자 하드웨어에서 약 12분 만에 가능합니다. 백프로파게이션(backpropagation)은 없고, 학습 토큰도 없고, 경사 하강법(gradient descent)도 없습니다.
로컬 편향을 제거하기 위해, 저희는 양자화되지 않은 FP16 체크포인트를 Hugging Face에 업로드했고, TPN Bench (TaoFu Protocol)가 공식 lm_eval 0.4.12 프레임워크를 사용하여 데이터센터 NVIDIA L4 GPU에서 독립적으로 평가했습니다 (coordinator run ce494664-d077-4ff1-8741-15cedabc434c). 클라우드 GPU 컴퓨팅을 제공해 준 TPN Bench에 진심으로 감사드립니다! 전체 ARC-Challenge(1,172개 항목, 제로샷, 탐욕적 온도 0)에 대한 독립적인 수치는 다음과 같습니다:
- Stock Qwen3.5-0.8B Base (양자화되지 않은 BF16): acc_norm 37.50% (acc 34.60%)
- 3 에포크 SFT 증류(Mythos-0.8B, 25k Claude 쌍, 다중 GPU DDP): acc_norm 38.10% (acc 35.80%)
- SFT + Model Soup Merge: acc_norm 37.00% (치명적 망각)
- Stock Qwen3.5-2B Base (2.5배 더 큰 모델, Q8): acc_norm 41.10% (acc 37.80%)
- DynamicTune 0.8B Base (저희의 4-앵커 폐쇄형 수술): acc_norm 42.15% (acc 40.19%)
이것이 왜 완전히 미친 일인지 설명하자면: 0.8B 모델이 물리적으로 2.5배 더 큰 2B 모델을 이겼습니다. LLM 스케일링에서 파라미터 개수는 왕이어야 합니다. 800M 모델이 ARC-Challenge에서 비압축된 2B 모델을 능가할 것이라고는 예상되지 않았습니다 (42.15% 대 41.10%). 4B에서 궤적 역학을 추출하여 학생의 SwiGLU 블록으로 되돌림으로써, 고차원 추론이 직접 에지 가중치에 압축되었습니다.
백프로파게이션 없이 25,000개의 SFT 명령어 쌍을 이기다: 최근 발표된 프로젝트(kmamine/merge-corrected-sft-distillation-Qwen-Mythos-0.8B)는 다중 GPU 클러스터에서 Qwen3.5-0.8B를 25,000개의 Claude 추론 쌍에 걸쳐 3 에포크 동안 학습시켜 과적합되기 전에 38.10%에 도달했습니다. DynamicTune은 경사 하강법, 손실 함수, 학습 토큰이 전혀 없음에도 불구하고 42.15%에 도달했습니다.
Ironclad은 3.23 시그마의 통계적 유의성을 갖습니다: 1,172개 질문에 걸쳐 +4.65%의 변화가 표준 오차(stderr) +-1.44%를 주어 Z-점수 3.23시그마(p < 0.001)를 제공합니다. 이는 프롬프트 튜닝 노이즈나 무작위 분산이 아닙니다. 소비자 하드웨어에서 12분 대 데이터센터 검증: 가중치 수술은 레이어 스트리밍(각 레이어를 FP16으로 로딩하고, 폐쇄형 근사값 SVD 델타를 계산한 후 RAM에 버림)을 사용하여 8GB AMD RX 580에서 현지적으로 약 12분 만에 해결되었습니다. 하지만 벤치마크는 TPN Bench를 통해 데이터센터 NVIDIA L4 하드웨어에서 클라우드 환경으로 100% 진행되었습니다. 과거 시도가 실패한 이유: 스펙트럴 엔트로피 장벽 학생의 모든 24개 레이어에 무분별하게 가중치 델타를 적용하면 모델이 붕괴합니다 (+64.78% NLL 폭발). 표현 잔여값의 정규화된 스펙트럴 엔트로피 H(0.0에서 1.0까지)를 계산하며 모든 24개 레이어를 스캔했을 때: * 레이어 0 (H = 0.71): 깨끗한 의미론적 접지(semantic grounding). 궤적 정렬에 높은 수용성을 보입니다. * 레이어 1-22 (H가 0.90에서 0.96 사이): 혼란스러운 중첩 매듭(Chaotic superposition knots). 1024차원만 가진 8억 개 모델에서는 다의미적 특징이 조밀한 중첩에 밀집되어 있습니다. 여기에 선형 업데이트를 강제하면 치명적인 간섭을 일으킵니다. * 레이어 23 (H = 0.93): 특징들이 어휘 로짓(vocabulary logits) 쪽으로 풀리는 전-언임베딩 경계입니다. 수술 범위를 4개의 희소 앵커 블록(레이어 0, 7, 15, 그리고 23)으로 제한하고 감쇠된 Levenberg-Marquardt Tikhonov 유사 역행렬에 적응형 스펙트럴 랭크 절단(adaptive spectral rank truncation)을 사용함으로써, 취약한 중첩 매듭은 보호하면서 교정적인 궤적 속도(corrective trajectory velocity)를 부여했습니다.
재현성 및 가중치 (REPRODUCIBILITY & WEIGHTS) 모든 것이 100% 오픈 소스이며 지금 바로 테스트할 수 있습니다: * GitHub 저장소: https://github.com/dsadawq3/DynamicTune * 기본 모델 (Safetensors): https://huggingface.co/F-Labs/Qwen3.5-0.8B-DynamicTune-Base * GGUF 체크포인트 (FP16): https://huggingface.co/F-Labs/Qwen3.5-0.8B-DynamicTune-Base-GGUF (Qwen3.5-0.8B-DynamicTune-Base-F16.gguf, SHA256: d77cf505108271d72f28298f20c2d158e7aeaf50cc22987db05a9a8973e08709) 표준 llama.cpp를 사용하여 로컬에서 추론을 실행하려면: llama-cli -m Qwen3.5-0.8B-DynamicTune-Base-F16.gguf -p "Question: How does DNA replication initiate?\nAnswer:" -c 2048 -n 128 TPN Bench (TaoFu Protocol)가 독립 데이터센터 NVIDIA L4 평가 리소스를 제공해 준 것에 특별히 감사드립니다. 저장소를 복제하고, 자체 벤치마크를 실행하며, 직접 테스트해보세요. 제출자: /u/AdventurousTwo6445 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기