추론에 대한 측도론적 분석: 구조적 일반화 및 근사 한계
요약
본 연구는 LLM의 분포 외(OOD) 일반화 메커니즘을 최적 운송(optimal transport) 이론과 Wasserstein-1 거리를 통해 수학적으로 분석합니다. 연구 결과, 위치 의존적 어텐션의 한계와 표현 붕괴를 방지하기 위한 물리적 계층 깊이 확장의 필요성을 이론적·실험적으로 입증하였습니다.
핵심 포인트
- 최적 운송 이론을 활용하여 도메인 변화(domain shifts)를 정량화하고 OOD 일반화 범위를 제한함
- Rotary Embeddings와 같은 변화 불변 메커니즘이 Absolute Positional Encoding보다 일반화 성능 유지에 유리함
- 표현 붕괴를 방지하기 위해서는 모델의 너비(width)가 아닌 물리적 계층 깊이(depth)를 확장하는 것이 필수적임
- Wasserstein 도메인 변화가 증가함에 따라 일반화 위험이 단조적으로 증가함을 확인
LLM(대규모 언어 모델) 추론에 대한 경험적 스케일링 법칙(scaling laws)은 잘 문서화되어 있지만, 분포 외(out-of-distribution, OOD) 일반화를 지배하는 이론적 메커니즘은 여전히 불분명합니다. 본 연구에서는 최적 운송(optimal transport)을 통해 추론을 공식화하며, 이산적 궤적(discrete trajectories)을 연속적인 메트릭 공간(metric space)으로 투영하여 Wasserstein-1 거리를 사용하여 도메인 변화(domain shifts)를 정량화합니다. Kantorovich 쌍대성(Kantorovich duality)을 호출하여, 아키텍처의 Lipschitz 연속성(Lipschitz continuity)과 함수 근사 한계(functional approximation limits)를 통해 OOD 일반화의 범위를 제한합니다. 이를 통해 두 가지 주요 제약 사항이 드러납니다. 첫째, 위치 의존적 어텐션(position-dependent attention, 예: Absolute Positional Encoding)은 변화 불변성(shift invariance)을 유지하지 못하여 $Ω(1)$의 Lipschitz 상수와 기대 위험(expected risk)을 생성하는 반면, 변화 불변 메커니즘(shift-invariant mechanisms, 예: Rotary Embeddings)은 등변성(equivariance)을 유지하고 오차를 제한합니다. 둘째, 순차적 백트래킹(sequential backtracking)을 Dyck-$k$ 언어로 매핑함으로써, $ ext{TC}^0$ Transformer에 대한 엄격한 회로 깊이 하한(circuit depth lower bound)을 설정합니다. 표현 붕괴(representation collapse)를 방지하기 위해서는 물리적 계층 깊이(physical layer depth)를 확장하는 것이 필수적이며, 이는 Barron 공간에서의 줄일 수 없는 근사 한계(irreducible approximation bounds)로 인해 표현 너비(representation width)를 확장하는 것만으로는 우회할 수 없는 제약입니다. 조합론적 탐색(combinatorial search)에 대한 54가지 Transformer 구성에 대한 평가를 통해 이러한 한계를 확인하였으며, 일반화 위험(generalization risk)이 Wasserstein 도메인 변화와 함께 단조적으로 저하됨을 입증하였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기