침입자 임계값: LoRA 미세 조정(Fine-Tuning)을 위한 스펙트럼 법칙
요약
LoRA 미세 조정 시 발생하는 '침입자 차원'과 치명적 망각 현상을 분석하고, 스펙트럼 법칙을 통해 이를 예측하는 이론을 제시합니다. 레이어별 임계값을 계산하여 망각이 발생하는 지점을 정확히 예측하고 성능 저하를 방지할 수 있습니다.
핵심 포인트
- LoRA 업데이트 시 사전 학습된 벡터와 직교하는 침입자 차원 발생
- 스펙트럼 분석을 통해 레이어별 망각 임계값 예측 가능
- 다양한 모델 아키텍처(Transformer, SSM, MoE)에서 법칙 검증 완료
- 스파이크 예산 규칙 적용 시 망각을 최대 62% 감소시킴
LoRA 미세 조정 (fine-tuning)은 침입자 차원 (intruder dimensions)을 생성할 수 있습니다. 이는 업데이트된 가중치 행렬 $W+BA$의 새로운 주요 특이 벡터 (leading singular vectors)로서, 모든 사전 학습된 특이 벡터 (pretrained singular vectors)와 거의 직교하며 치명적 망각 (catastrophic forgetting)을 유발합니다. 이러한 침입자 차원이 발견된 이후, 측정된 스펙트럼 (spectra)을 바탕으로 레이어별로 이들이 언제 나타날지를 예측하는 이론은 없었습니다. 본 연구에서는 피팅된 파라미터 없이, 직사각형 스파이크 변형 변환 (rectangular spiked-deformation transform)을 통해 $W$의 측정된 스펙트럼만으로 계산되는 레이어당 임계 업데이트 강도 $s^\ast=\bar\theta/(\gamma\sigma_1(BA))$를 도출하며, 업데이트된 스펙트럼에 대한 정확한 세큘러 방정식 (secular-equation) 특성을 함께 제시합니다. 4개의 밀집 트랜스포머 (dense Transformer) 제품군, 상태 공간 모델 (state-space model), 혼합 전문가 모델 (mixture-of-experts model), 그리고 인코더-디코더 (18개의 어댑터, 9,840개의 레이어 스캔)를 아우르는 사전 지정된 연구에서, 이 법칙은 레이어의 $82%$에서 경험적 임계값을 2배 이내의 오차로 국소화하며, 배포 시 침입자가 있는 레이어와 없는 레이어를 평균 AUC $0.89$로 구분합니다. 또한 6개의 제3자 어댑터에서도 변함없이 유지되며, WikiText-2 퍼플렉시티 (perplexity)가 저하되기 시작하는 지점을 예측합니다. 사전 지정된 두 가지 엣지 평가 (edge evaluations)의 조합은 $98%$에 도달하며, 외부 어댑터에 대한 교차 검증 (out-of-bag)에서도 $0.997$을 기록했습니다. 전체 미세 조정 (Full fine-tuning)은 업데이트를 모든 레이어의 임계값보다 훨씬 낮은 수준으로 분산시키며, 이는 LoRA와 전체 미세 조정 사이의 비대칭성을 해결합니다. 정규화 매칭 개입 (Norm-matched interventions)을 통해, 망각을 유발하는 것은 업데이트 크기가 아니라 임계값을 넘어서는 레이어임을 확인했습니다. 또한, 단 한 번의 SVD와 검증 스윕 (validation sweeps) 없이 임계값에서 도출된 스파이크 예산 규칙 (spike-budget rule)을 적용했을 때, 가장 취약한 모델에서 작업 성능 저하 없이 망각을 $62%$ 감소시켰습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기