닫힌 형식의 궤적 가중치 수술: 수십억 토큰 없이 4B 능력을 0.8B로 전이하기 (중간 레이어가 깨지는 이유와 4개 앵커 블록으로 이를 고친
요약
본 연구는 표준 지식 증류 방식 대신, 레이어 간 '닫힌 형식의 궤적 일치' 문제를 통해 소형 학생 모델(0.8B)에 대규모 교사 모델(4B)의 능력을 전이하는 새로운 방법을 제시합니다. 기존 방법론의 한계를 극복하기 위해 중간 레이어 전체를 수정하는 대신, 표현 구조가 깨끗한 4개의 '앵커 블록'만 선택적으로 가중치 업데이트를 수행했습니다.
핵심 포인트
- 전통적인 지식 증류 방식 대신 궤적 일치 문제를 활용하여 전이 학습을 시도함.
- 모델의 불안정성을 해결하기 위해 전체 레이어가 아닌 4개 앵커 포인트에 집중하여 수술함.
- H100 같은 고성능 장비 없이 구형 GPU(RX 580)에서 실험 및 검증을 완료함.
- 전이된 모델은 다양한 벤치마크에서 성능 향상을 보였으며, 코딩 능력 등에서도 개선됨.
표준 지식 증류(distillation)는 보통 몇 주 동안의 컴퓨팅 자원과 수십억 개의 토큰을 소모하며, 학생 모델(student model)이 결국 교사 모델(teacher model)을 모방하기를 기대하는 것을 의미합니다. 우리는 역전파(backprop)를 완전히 건너뛰고 전이를 레이어 간 닫힌 형식의 궤적 일치 문제로 다루면 어떤 일이 발생하는지 보고 싶었습니다. 아이디어는 간단합니다. 두 모델 모두에 소량의 보정 프롬프트(calibration prompts) 배치(batch)를 공급하고, 레이어별 은닉 상태 궤적(layer-to-layer hidden state trajectories)을 포착한 다음, 정규화된 최소 제곱법(regularized least squares)과 스펙트럴 투영(spectral projection)을 사용하여 학생의 MLP 블록에서 가중치 업데이트를 직접 해결하는 것입니다. 우리는 두 가지 아키텍처에 걸쳐 이를 테스트했습니다: Qwen 3.5 (4B에서 0.8B로 전이)와 오래된 GPT-2 small입니다. 후자는 일반적으로 가중치를 건드리면 평소처럼 의미 없는 횡설수설(gibberish)로 즉시 분해될지 확인하기 위해서였습니다. 둘 다 일관성을 유지했지만, 초기 Qwen 테스트는 한계에 부딪혔습니다: Qwen 0.8B의 모든 24개 레이어를 편집하자 모델이 완전히 녹아내렸고 (+64.78% NLL loss explosion) 손실 폭발을 일으켰습니다. 네트워크 전반에 걸쳐 특이값 엔트로피(singular value entropy)를 확인했을 때, 1층부터 22층까지의 레이어는 엔트로피가 0.90을 초과하는 혼란스러운 다의적 수프(polysemantic soup)였습니다. 이 중간 레이어를 통해 원시 궤적(raw trajectories)을 강제로 통과시키려고 하면 기본적으로 모델의 내부 기억 매듭(internal memory knots)을 뒤섞어 버립니다. 해결책은 표현이 실제로 깨끗한 선형 구조를 유지하는 4개의 앵커 포인트(레이어 0, 7, 15, 그리고 23)로 수술 범위를 제한하는 것이었습니다. 그렇게 하자 다음과 같은 결과가 나왔습니다: 보류된 NLL(Held-out NLL)이 30가지 다양한 벤치마크에서 10.8% 감소했습니다 (-생의학 분야 -23.8%, 수학 및 논리 분야 -14.6%). 제로샷(Zero-shot) 400개 태스크 HellaSwag 점수가 54.75%에서 55.25%로 증가했습니다 (+0.50%), 이는 Vulkan llama.cpp에서 로컬로 검증되었습니다. 기본 0.8B 모델은 원래 이진 트리 역변환(binary tree inversion)을 수행할 때 죽은 주석 처리된 유사 코드(dead commented pseudo-code)를 출력하며 실패했습니다. 편집된 체크포인트는 첫 시도에 깨끗한 재귀적 Python 코드를 작성했습니다. 러시아어 논리 역설에 대해서는 심지어 <think> 추론 태그를 자발적으로 발생시키기 시작했는데, 이는 채팅 템플릿이 적용되지 않은 원시 기본 모델에서는 놀라운 일이었습니다. 무엇보다도: 우리는 H100 클러스터나 심지어 4090 카드조차 가지고 있지 않습니다.
모든 궤적 추출 및 가중치 해결은 레이어별 VRAM 스트리밍과 Qwen의 Gated DeltaNet 어텐션이 드라이버 오류를 일으키는 것을 막기 위한 DirectML 패치를 사용하여 구형 8GB RX 580에서 로컬로 수행되었습니다. 검사하거나 재현하고 싶다면 모든 것이 오픈 소스입니다: 코드 및 수학 정리: https://github.com/dsadawq3/DynamicTune 전이된 기본 모델 가중치: https://huggingface.co/F-Labs/Qwen3.5-0.8B-DynamicTune-Base 만약 이 분야에 관심 있는 분들 중 24GB32GB 카드(4090, 5090 또는 서버 실리콘)를 가지고 계시고 더 발전시키고 싶은 분이 있다면, 다음을 테스트하는 것이 흥미로울 것입니다: 27B 모델의 추론 궤적을 9B, 4B 또는 2B까지 이식하는 것. 몇 주간의 재훈련 없이 대형 모델(예: Gemma)을 모바일 크기로 압축하는 것. 검열되지 않은 모델에서 거부-제거 벡터를 미세 조정 없이 직접 이식하는 것. 레이어 122를 건너뛰지 않기 위해 사전 학습된 Sparse Autoencoders (SAEs)를 사용하여 풀리는 것. 질문에 답하거나 댓글에서 실패 모드를 깊이 파고드는 것을 기꺼이 하겠습니다. /u/AdventurousTwo6445가 제출했습니다 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기