의미 공간의 기하학: Transformer 아키텍처를 위한 연속 기하학적 프레임워크
요약
Transformer 아키텍처의 이산적 연산을 연속 기하학적 프레임워크로 모델링하는 새로운 연구를 제시합니다. 미분 기하학 및 확률 미적분학을 통해 RMSNorm, Attention, SGD 등 핵심 구성 요소를 정량적으로 분석하고 예측합니다.
핵심 포인트
- Transformer의 핵심 요소를 미분 기하학 및 측도론 기반의 연속 모델로 변환
- Attention을 엔트로피 최적 운송 관점에서, SGD를 비평형 열역학 관점에서 해석
- Qwen3, LLaMA-3.1, Gemma-3 등 다양한 모델을 통한 실험적 검증 완료
- 모델의 안정성 한계 및 문맥 경계에 대한 예측 가능한 기술적 어휘 제공
우리는 Transformer 아키텍처의 이산적 대수 연산(discrete algebraic operations)을 의미 파이버 번들(semantic fiber bundle) $\calE = \calM \times \R^d$ 상의 적분-미분 방정식 (integro-differential equation, IDE)으로 모델링하는 연속 기하학적 프레임워크를 제시합니다. 토큰 시퀀스가 정준 측도 격자(canonical measure lattice)를 갖춘 이산적 $1$-매니폴드(1-manifold)를 형성한다는 단일 기하학적 공리로부터 시작하여, 우리는 현대 Transformer의 모든 핵심 구성 요소(RMSNorm, RoPE, Softmax Attention, FFN, Residual Stream, SGD, Weight Decay)를 미분 기하학(differential geometry), 측도론(measure theory), 확률 미적분학(stochastic calculus)의 응집력 있는 어휘로 변환합니다. 결과적으로 도출된 프레임워크는 엔트로피 최적 운송(entropic optimal transport, Schrödinger bridge로서의 Attention)과 비평형 열역학(non-equilibrium thermodynamics, 상세 균형을 위반하는 Itô 확산으로서의 SGD)을 아우르는 정량적 예측을 제공합니다. 우리는 $124$M에서 $8$B 파라미터에 이르는 5가지 아키텍처(Qwen3, LLaMA-3.1, Gemma-3, GPT-2, Mistral)에 대해 6부작 실험 캠페인을 수행합니다. 경험적 관측값들은 기하학적 예측과 정량적으로 일치합니다: 기계 정밀도에서의 $\epsilon^{-1/2}$ Lipschitz 스케일링 보정($R^2 = 1.000$), Lie--Trotter 연산자 분할 비틀림(operator-splitting torsion), 위상적 안정성의 이중 법칙(Dual-Law of Topological Stability)을 확인하는 대칭적 절제 불안정성(symmetric ablation instability), RoPE 토러스 상에서 Poincaré 재귀(Poincaré recurrence)의 $\calO(1/\sqrt{k})$ 열역학적 억제, 열역학적 문맥 한계(thermodynamic context-limit) 상전이, 그리고 비평형 정상 상태(Non-Equilibrium Steady State) 파라미터 와류(vortex) — 이 모든 것은 모멘텀 아티팩트를 배제하기 위해 두 가지 옵티마이저(AdamW 및 Pure SGD)를 통해 검증되었습니다. 이 결과는 연속 확률 미분 기하학(continuous stochastic differential geometry)의 관점에서 Transformer를 분석하는 것이 대규모 언어 모델(Large Language Models)의 안정성 한계, 문맥 경계 및 최적화 역학에 대한 예측 가능한 기술적 어휘를 제공함을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기