보정 데이터 없이 자르는 방법: LILA가 특이값 분포의 KS 거리만으로 LLM을 구조화 가지치기하는 원리
요약
LILA(Latent-Informed Layer Analysis)는 별도의 보정 데이터나 미세 조정 없이 LLM의 FFN을 구조화 가지치기하는 새로운 방법을 제시합니다. 이 방법은 특이값 분포의 KS 거리 변화를 중요도 점수로 활용하여, 가중치의 스펙트럴 기하학만으로 뉴런의 중요도를 판단할 수 있음을 입증했습니다.
핵심 포인트
- 보정 데이터/미세 조정 없이 LLM 구조화 가지치기 가능
- 특이값 분포의 KS 거리 변화를 중요도 점수로 사용
- LLaMA-2 대비 최대 6.0pp 개선 등 높은 성능 달성
- 가중치의 스펙트럴 기하학만으로 충분한 정보 확보
서론
LLM을 엣지 디바이스나 비용 제약이 심한 환경에서 구동하고 싶을 때, 구조화 가지치기(structured pruning)는 실용적인 선택지가 됩니다. FFN의 은닉 차원 전체를 제거하기 때문에 cuBLAS나 SDPA 같은 표준 커널 그대로 추론 속도를 높일 수 있습니다. 하지만 기존 방법들의 전제 조건을 살펴보면 이야기가 복잡합니다. Wanda는 보정 데이터로부터의 활성화 통계가 필수적이며, SliceGPT는 대량의 보정 샘플로 PCA 회전을 학습하고 심지어 아키텍처를 영구적으로 변경해 버립니다. PruneNet에 이르러서는 가지치기 방침 자체를 45M 파라미터의 RL 정책 네트워크로 학습합니다.
"가중치 행렬을 수학적으로 관찰하는 것만으로, 어떤 뉴런이 불필요한지 알 수 없는 걸까?"
LILA (Latent-Informed Layer Analysis, arXiv:2609.11163)는 이 질문에 '알 수 있다'고 답한 논문입니다. FFN의 up-projection 가중치를 비음수 행렬로 만들어 NMF로 분해하고, 뉴런을 하나 제거했을 때의 **특이값 분포 변화(KS 거리)**를 중요도 점수로 사용합니다. 보정 데이터 제로, 학습 제로, 폐쇄 형식 계산만으로 WikiText-2 보정의 SliceGPT를 noRFT로 최대 6.0pp 상회했습니다.
본 글에서는 KS 거리를 이용한 스펙트럴 스코어링의 메커니즘, NTK 분석을 통한 이론적 근거, 그리고 '단일 레이어 33% 이상의 압축이 LLaMA-2의 파탄 임계값'이라는 흥미로운 발견까지 정리합니다.
요약 (TL;DR)
- LILA는 보정 데이터, 기울기 계산, 보조 네트워크가 전혀 없이 LLM의 FFN을 구조화 가지치기하는 방법입니다. 특이값 분포의 KS 거리를 폐쇄 형식으로 계산합니다. - 뉴런의 중요도는 '제거 전후 특이값 ECDF의 차이'입니다. 제거해도 분포가 변하지 않는 뉴런은 스펙트럴적으로 중복됩니다. $\sup_t|F_\sigma(t)-F_\sigma^{(-j)}(t)|$ - 보정 없음, 미세 조정 없음으로 LLaMA-2-7B의 25% 희소도에서 45M 파라미터 RL 정책 PruneNet보다 +1.57pp, WikiText-2 보정 SliceGPT보다 최대 +6.0pp 우수합니다. 아키텍처도 원본 그대로입니다. - 1 에포크의 LoRA 복구 미세 조정(RFT) 후에는 Alpaca 보정 + RFT의 SliceGPT와 평균 0.48pp 차이까지 근접합니다. - NTK 분석으로 무작위 가지치기의 22배 기능 왜곡 감소를 확인했습니다. 가중치의 스펙트럴 기하학만으로 충분한 중요도 신호를 얻을 수 있음을 이론적/실험적으로 입증했습니다. - KS 점수를 레이어별 예산 분배에 사용하면 25% 압축에서 PPL이 개선(LLaMA-2: 11.14 $\to$ 9.50)되지만, 30%에서는 단일 레이어 병목 현상이 파탄점(PPL 281.47)에 도달하며 붕괴합니다.

배경: 구조화 가지치기의 '보정 데이터 문제'
먼저 전제를 정리하겠습니다. Transformer의 FFN 레이어는
라는 두 개의 행렬 곱으로 표현됩니다. 구조화 가지치기는
이 '어떤 뉴런을 버릴지'를 판단하는 데, 지금까지의 방법들은 외부 정보를 요구해 왔습니다.
- Wanda: 보정 샘플 128개로부터의 활성화 노름으로 가중치를 곱하여 점수를 매깁니다. 데이터 필수.
- SliceGPT: 보정 데이터를 이용해 PCA 회전 행렬을 학습하고 임베딩 차원을 슬라이스합니다. 대량의 보정에 더해, 회전 후 아키텍처에 영구적으로 개입하기 때문에 원본 체크포인트나 추론 스택과의 호환성이 상실됩니다.
- PruneNet: 가지치기 방침을 45M 파라미터의 RL 정책으로 학습합니다. 방침 학습 자체가 하나의 프로젝트가 됩니다.
LILA의 출발점은 단순합니다. '가중치 행렬 자체의 스펙트럼 구조에, 뉴런의 중요도가 기록되어 있을 것이다'라는 주장입니다. 이를 검증하기 위해, 해당 논문은 3가지 평가 기준(잔차 에너지, 재구성 민감도, 그리고 핵심인 KS 거리)을 구현하여 순수한 가중치 기하학만으로 어디까지 할 수 있는지 시도하고 있습니다.
방법 상세: 특이값 분포의 변화를 중요도로 읽기
단계 1: 가중치를 비음수 행렬로 만들기
NMF는 비음수 행렬에만 적용할 수 있으므로, up-projection의 가중치
- Abs: 부호(符号)를 버리고 절댓값의 기하학적 정보만 본다. 완전 데이터 프리(data free). $M = |W|$ -
Split: 양성 성분과 음성 성분을 세로로 쌓아 $ ext{ReLU}(W)$의 2배 높이 행렬을 만든다. 부호의 매니폴드(manifold)를 개별적으로 모델링할 수 있다. 이것 역시 완전 데이터 프리. ext{ReLU}(-W) $-
Act: 교정 데이터(calibration data)에서의 평균 절대 활성화로 가중치를 스케일링한다. Wanda 방식의 활성화 가중치 부여를 NMF 전처리 단계로 사용하는 버전으로, 128개 샘플의 교정이 필요하다.
단계 2: NMF로 저랭크 기저(low-rank basis) 얻기
단계 3: KS 거리로 점수 매기기 (핵심)
여기가 본 논문의 주요 기여 부분이다. 뉴런
먼저 완전한
다음으로 Kolmogorov–Smirnov 통계량을 점수로 사용한다:
직관은 이렇다. 뉴런

단순하게 처리하면 각 뉴런마다 SVD를 다시 해야 해서 파국적이지만, 여기서 rank-1 downdate의 근사치가 효과를 발휘한다. Weyl의 특이값 섭동 부등식에 의해
나머지는 각 레이어에서 점수 순으로 Top-K를 가져오고, 아키텍처는 원래 그대로다.
이론적 배경: NTK로 본 기능 왜곡
'특이값 분포를 보존하는 가지치기가 모델의 기능을 보존하는가?'를 확인하기 위해, 동 논문은 Neural Tangent Kernel (NTK)의 trace 비율
Phi-2, 25% 희소도(sparsity)에서의 결과가 인상적이며, 무작위 가지치기는 **LILA-Sensitivity (Split)**에서 방향이 아니라 폭에만 영향을 미친다는 것도 밝혀졌다. LILA-Spectrum에서도
이론적으로는 보존된 뉴런이
실험 결과
설정은 LLaMA-2-7B / Phi-2 / OPT-1.3B・2.7B / LLaMA-2-13B 각 모델에서, 희소도 20~40%이다. 평가는 PIQA・HellaSwag・ARC-Easy・ARC-Challenge・WinoGrande의 5개 벤치마크 zero-shot 평균 정확도와, WikiText-2 test의 PPL(퍼플렉서티)을 사용했다. RFT는 8,192개의 Alpaca (또는 WikiText-2)로 1 에포크의 LoRA (rank=32,

noRFT (미세 조정 없음)에서의 대결
LLaMA-2-7B, 교정 데이터 프리인 **LILA-Spectrum (Abs)**의 수치가 본질적이다.
| 기법 | 교정 | 20% | 25% | 30% |
|---|---|---|---|---|
| Dense | – | 69.00 | 69.00 | 69.00 |
| LILA-Spectrum, Abs | 없음 | 63.35 | 60.20 | 57.50 |
| PruneNet (RL 정책) | RL 학습 | 61.67 | 58.63 | 55.45 |
| SliceGPT (WT2 교정, noRFT) | WT2 | 58.18 | 55.48 | 51.50 |
| Wanda | 128개 샘플 | 58.14 | 54.98 | 51.21 |
- PruneNet은 25%에서 +1.57pp (20%/30%에서도 +1.68/+2.05pp). 45M 파라미터의 RL 학습에, 폐쇄 형식(closed form)의 KS 거리가 승리했다.
- WT2 교정의 SliceGPT는 최대 +6.00pp. Alpaca 교정의 SliceGPT와의 차이도 0.33~0.71pp로 유지된다.
- OPT-1.3B에서는 Wanda에 20%에서 +13.03pp (PPL 2543.18 → 15.85). 비구조화 가지치기 기반의 Wanda가 소규모 모델에서 붕괴하는 반면, LILA는 Dense의 49.56을 20% 희소도에서도 유지했다.
RFT 후의 안착
1 에포크 LoRA 회복 미세 조정 후에는, 최적 구성으로 SliceGPT+RFT와의 평균 차이가 −0.48pp (교정 데이터 프리 구성만으로도 −0.47pp). 교정 데이터를 전혀 사용하지 않고도, 무거운 교정+RFT의 베이스라인과 거의 대등하다.
스펙트럼 기하학만으로 충분하다는 제거 실험(Ablation)
3×3 매트릭스 제거 실험이 이 논문에서 가장 설득력 있는 실험이라고 생각한다. LLaMA-2-7B, 25%, noRFT 조건에서:
| 변환 | Residual | Sensitivity | Spectrum |
|---|---|---|---|
| Abs | 37.25 | 37.31 | 60.01 |
| ... | |||
| KS 거리(Spectrum)만은 어떤 변환에서도 60%대를 유지했다. 반면, 잔차 에너지나 재구성 민감도는 교정 데이터가 없는 Abs/Split에서는 PPL 수천의 붕괴를 일으킨다. 즉, '저랭크 NMF 기저에 놓이지 않는 정보량'과 같은 언뜻 그럴듯한 기준은 순수한 가중치 기하학만으로는 기능하지 않는다. 분포의 변위를 보는 상대적인 양인 KS 거리만이 데이터 없이도 유효한 신호를 내보낸다. |
흥미로운 점은, Act(교정 있음)가 LLaMA-2의 30%에서 붕괴하여 45.97%로 떨어진 반면, 데이터 프리(data-free)인 Abs/Split은 57.50/56.89를 유지했다는 점이다. 교정 데이터에서 유래한 가중치가 고압축에서는 오히려 불안요인이 된다. 순수한 가중치의 스펙트럼 기하학이 더 견고했다.
추론 처리량과 계산 비용
구조화 가지치기의 실질적인 이점으로, 25% 희소(sparse)로 LLaMA-2-13B는 1.64×, 7B는 **1.33×**의 처리량 향상(단일 A100, 배치 크기 1)을 보였다. 특수 커널이 필요 없다.
가지치기의 계산 비용은 Spectrum 분할이 LLaMA-2에서 44분인 반면, Sensitivity 분할은 2.4분이다(약 18배 빠름). Sensitivity + RFT는 Spectrum + RFT의 성능의 98% 이상(61.42 vs 62.56)을 달성하므로, 시간 제약이 엄격하다면 실용적인 대안이 된다.

동적 예산 할당과 '단일 레이어 33%의 벽'
KS 점수는 레이어별 민감도 맵을 무료로 제공한다. LLaMA-2-7B에서는 초기 레이어(0–5)와 후기 레이어(28–31)가 체계적으로 높은 점수를 보였으며, 레이어별 평균 KS 점수와 가지치기 후의 정확도 유지율 사이에는 음의 상관관계(Pearson)가 존재했다.
이에 따라 점수에 비례하여 레이어별 생존 예산을 할당하는 Adaptive Sparsity를 시도하자, 25% 압축에서 생성 품질이 크게 개선되었다(LLaMA-2 PPL: 11.14→9.50, Phi-2: 54.07→40.03).
하지만 30%에서는 극적인 역전 현상이 발생했다. 민감한 레이어를 보호하는 대신, 견고한 레이어의 생존 하한이 281.47로 폭발하며 정확도는 40.00까지 떨어졌다. 레이어별 KS 민감도 분석에서 도출된 결론은,
⚠️ [IMG:N] 형식 토큰은 이미지 placeholder 입니다. 번역하지 말고 원래 위치에 그대로 유지하세요.
Wanda: 가중치 노름(weight norm) × 활성화 노름(activation norm)의 비구조적 가지치기(unstructured pruning). 128개의 보정(calibration)이 필요하며, 소규모 모델에서 PPL(Perplexity)이 붕괴한다. LILA의 Act 변체는 그 사상을 NMF 전처리 과정에 통합한 비교 대상이다.
SliceGPT: PCA 회전(rotation)을 통한 임베딩 차원 슬라이싱. 보정 및 아키텍처 변경이 비용으로 발생한다. LILA는 '아키텍처 유지'와 '보정 불필요(calibration-free)'라는 두 측면에서 대항했다.
PruneNet: RL 정책(policy)을 이용한 구조적 가지치기. 45M의 학습 비용 대비, LILA는 폐쇄형(closed-form)으로 동등하거나 그 이상의 성능을 보인다.
SparseGPT / LLM-Pruner: Hessian 근방(neighborhood)에 기반한 가지치기 계열. 기울기 또는 활성화 통계량을 요구한다는 점에서 LILA와 '정보원'이 다르다. 다만, SVD 기반의 가중치 압축이라는 맥락에서는 SVD-LLM 같은 저랭크 근사(low-rank approximation) 시스템과 유사한 문제 의식을 갖지만, LILA는 근사가 아니라 '뉴런 단위의 선택'에 KS 통계량(KS statistic)을 도입했다는 점이 신규성이다.
요약 (Summary)
LILA는 LLM의 FFN 구조적 가지치기(structured pruning)를 '가중치 행렬의 스펙트럼 기하학(spectral geometry)'만으로 해결하는 방법론이다. NMF로 저랭크 기저(low-rank basis)를 추출하고, 뉴런 제거 전후의 특이값 분포(singular value distribution)의 KS 거리를 폐쇄형으로 계산하면, 보정 데이터 없이도 실용적인 중요성 점수(importance score)를 얻을 수 있다. noRFT에서는 PruneNet보다 +1.57pp, WT2 보정 SliceGPT에 대해서는 최대 +6.0pp, RFT 후에는 Alpaca 보정 +RFT의 SliceGPT와 0.48pp 차이까지 근접한 결과는 '가지치기에는 보정 데이터가 필요하다'는 통념에 대한 실질적인 반례를 제시한다.
개인적으로 가장 흥미로운 점은 KS 점수가 단순한 가지치기 지표를 넘어, 모델의 구조적 취약성(단층 33%의 벽, 초기 레이어와 말기 레이어의 민감도)을 시각화하는 진단 도구로 기능했다는 것이다. 가지치기 방법이 '어디를 자를지'뿐만 아니라 '어디가 잘릴 수 있는지'에 대한 지도(map)를 동시에 제공한다는 것은 응용 범위가 넓을 것 같다고 생각한다.
참고 (References)
- 논문: LILA: Calibration-Free Structured Pruning of Large Language Models via Latent Spectral Geometry (arXiv:2609.11163)
- SliceGPT: Compress Large Language Models by Deleting Rows and Columns
- A Simple and Effective Pruning Approach for Large Language Models (Wanda)
- You Only Prune Once: Designing Calibration-Free Model Compression With Policy Learning (PruneNet)
토론 (Discussion)

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn ML의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기