효율적인 회로 추출을 위한 희소 가중치 분해 (Sparse Weight Decomposition)
요약
사전 학습된 트랜스포머 모델의 회로 추출을 효율화하기 위한 '희소 가중치 분해(SWD)' 방법론을 제안합니다. 별도의 모델 훈련 없이 가중치 행렬을 두 개의 희소 인자로 분해하여, 기존 방식보다 훨씬 적은 데이터로도 높은 충실도를 유지하며 해석 가능한 회로 단위를 추출할 수 있습니다.
핵심 포인트
- 가중치 행렬을 두 개의 희소 인자로 재매개변수화하여 회로 추출 효율성 증대
- 기존 베이스라인 대비 1% 미만의 데이터만으로도 유사한 충실도 달성
- GPT-2, Qwen2.5, Qwen3.5-27B 등 다양한 모델에서 성능 검증
- 데이터가 없는 상황에서도 기계론적 해석 가능성 분석 지원 가능
밀집된 사전 학습된 트랜스포머 (Dense pretrained transformers)는 회로 추출 (circuit extraction)을 위한 해석 가능한 단위 (interpretable units)를 자연스럽게 노출하지 않습니다. 기존의 접근 방식들은 보조적인 희소 표현 (auxiliary sparse representations)을 학습하거나 희소 모델 (sparse models)을 훈련함으로써 이러한 단위를 얻지만, 이는 상당한 추가 계산 비용을 발생시키며 분석 대상이 되는 표현과 원래의 사전 학습된 모델 사이에 충실도 격차 (fidelity gap)를 유발할 가능성이 있습니다. 우리는 사전 학습된 선형 투영 (linear projections)을 각 가중치 행렬을 두 개의 희소 인자 (sparse factors)로 인수분해하여 재매개변수화하는 희소 가중치 분해 (Sparse Weight Decomposition, SWD)를 제안합니다. 이때 공유된 중간 좌표는 개별적으로 주소 지정 가능한 회로 단위 (circuit units) 역할을 합니다. 별도의 대체 네트워크를 훈련하지 않고도, 이 매개변수적 표현 (parametric representation)은 희소 특징 (sparse features)을 학습하는 방법론에서 사용되는 것과 동일한 스코어링 (scoring), 선택 (selection), 그리고 절제 (ablation) 회로 추출 워크플로우를 지원합니다. 단일 행렬 교체 (single-matrix replacements) 실험에서, SWD는 Transcoder 및 기타 강력한 베이스라인들이 달성한 홀드아웃 충실도 (held-out fidelity)와 일치하면서도, 해당 베이스라인들이 대체 모델을 훈련하는 데 사용하는 데이터의 1% 미만만을 사용합니다. 동일한 교체 충실도(matched replacement fidelity) 조건에서, SWD는 GPT-2, Qwen2.5, 그리고 Qwen3.5-27B에 대한 작업 전반에 걸쳐 더 적은 활성 읽기/쓰기 엣지 (active read/write edges)와 선택된 단위로 동일한 회로 충분성 (circuit sufficiency) 및 필요성 (necessity) 목표에 도달합니다. 나아가 우리는 0이 아닌 인자 값 (nonzero factor values)을 미세 조정 (fine-tuning)한 후, 모든 어텐션 (attention) 및 MLP 가중치 행렬에 대해 전체 모델 교체 (full-model replacement)를 수행해도 SWD가 효과적임을 보여줍니다. 마지막으로, SWD는 데이터가 없는 변형 (zero-data variant) 기능도 갖추고 있어, 기계론적 해석 가능성 (mechanistic interpretability) 분석(예: 단계별 분석)을 더 폭넓게 사용할 수 있도록 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기