추론 시 정확성: 분포 외 일반화에 대한 표현적 기준
요약
본 기사는 모델이 훈련 분포를 벗어난 영역(외삽)에서 일반화하기 위한 필수 조건을 논합니다. 단순히 근사치가 아닌, 구조적으로 동등한 정확한 표현 계산 능력이 필요하며, 이는 추론 시의 정확성에 의해 지배됩니다. Tensor Logic이나 미분 가능 ILP 같은 접근 방식이 이러한 요구사항을 충족함을 보여줍니다.
핵심 포인트
- 외삽 일반화는 단순 근사치가 아닌 '구조적 등가성'을 요구함.
- 추론 시의 정확성이 외삽 성능을 결정하는 핵심 요소임.
- Tensor Logic과 미분 가능 ILP가 높은 정확성을 보이며, 기존 신경망은 한계가 있음.
- 정확한 표현 가능성은 일반적인 귀납적 편향보다 중요할 수 있음.
모델이 훈련 분포를 벗어나 일반화하려면, 생성 메커니즘과 구조적으로 동등한 표현(representation)을 계산해야 하며, 단순히 그것에 맞춰진 근사치여서는 안 된다. 이러한 등가성은 분포 내외에서 정확성(exactness)에 필수적이며, 외삽(extrapolation)은 그 실현 방식에 관계없이 이 추론 시의 정확성에 의해 지배된다. Tensor Logic이 이를 보여준다: 0-온도 수축(zero-temperature contraction)은 이산 논리(discrete logic)와 동등하며, 아티팩트(artefact)를 추출하지 않고 제자리에서 전개하여 그 텐서(tensors)를 Boolean으로, 임베딩(embeddings)을 직교(orthonormal)로, 오직 산술만 연속적(continuous)이다. 무한 재귀가 부족하기 때문에 Prolog이 아닌 Datalog에 도달하며, 폐쇄된 영역(closed domains)에서는 정확하지만 새로운 개체(novel entity)를 바인딩하려면 외부 메모리가 필요하다. 이 기준은 이산 표현이나 추출된 표현을 필요로 하지 않으며, 훈련이 아니라 추론을 제약한다: $[0,1]$ 범위의 정확한 주변값(exact marginal)은 통과하지만, 하드 레이블로 임계 처리된 신경망(Neural Network)은 그렇지 못하다. Logic Tensor Networks는 이를 실패하고, 반면 미분 가능 ILP(differentiable ILP)와 $T=0$에서의 Tensor Logic은 통과한다. 조각별-아핀 외삽 발산(Piecewise-affine extrapolation divergence)과 새로운 개체를 바인딩할 수 없는 능력은 정확한 표현 가능성(exact representability)의 부족이라는 두 가지 측면이다. 하이브리드 아키텍처의 경우, 전파 규칙이 따른다: 출력은 경로상의 모든 적합 추정기(fitted estimator)의 경계를 상속받으며, 이는 등변 모델(equivariant models)에서 어떤 축이 실패하는지 그리고 ARC-AGI의 귀납/변환 분할을 설명한다. 오직 정확한 가설 클래스(exact hypothesis class)만이 훈련 데이터가 결정되지 않은 상태로 남겨둔 것을 인증한다: 법칙으로 도출된 분할(law-derived partition) 위에서 그것은 답변 가능한 원거리 질의(distant queries) 중 $56.3%$를 찾아내며, 어떤 앙상블(ensembles)이 잘못된 확신과 거리 측정값으로 순위를 매기는지 보여준다. 대칭성부터 메모리에 이르기까지 일반적인 귀납적 편향(inductive biases)은 인간이 주입했기 때문에 정확성에 도달하며, 이는 잔여물(residuals)이 훈련 시 산술 하한선에서도 데이터 외부에서 발산하고 구성 과정에서 복합적으로 작용하는 적합 추정기 대신 정확한 표현을 유도해야 한다는 주장이다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기