용량(Capacity)이 아닌 확률적 특성(Stochasticity)을 희소화하기: 사전 스케일의 심층 가중치 분해를 통한 부분적인 확률성 구현
요약
본 논문은 베이지안 신경망이 완전한 확률적일 필요 없이, 매개변수의 일부만 확률적으로 유지하는 방법을 제안합니다. 심층 가중치 분해를 통해 사전 스케일을 학습하고, 특정 임계값 이하의 매개변수는 결정론적으로 최적화하여 모델의 효율성을 높입니다. 이 방법은 기존 방식보다 우수한 성능과 안정성을 입증했습니다.
핵심 포인트
- 사전 스케일 분해로 확률성(Stochasticity)을 희소화합니다.
- 일부 매개변수를 결정론적으로 최적화하여 계산 효율성을 높였습니다.
- 완전히 확률적인 네트워크와 동등한 성능을 보입니다.
- 기존 무작위 마스크 방식보다 훨씬 안정적이고 우수합니다.
베이지안 신경망(Bayesian neural networks)이 보편적인 조건부 밀도 근사기(universal conditional density approximators)가 되기 위해 완전히 확률적일 필요는 없지만, 어떤 매개변수가 확률적이어야 하는지에 대해서는 여전히 미해결 문제입니다. 우리는 사전 스케일(prior scales), 즉 매개변수 사전 분포의 표준편차에 심층 가중치 분해(deep weight factorization)를 적용하여 이 분할을 학습하며, 최대 평균 불일치(maximum mean discrepancy) 목적 함수와 함께 기능적 사전 분포(functional prior)를 가우시안 프로세스(Gaussian process)에 적합합니다. 사전 스케일이 특정 임계값(cutoff) 아래로 떨어지는 매개변수는 결정론적(deterministic)이 되어 추론 과정 동안 최적화되며, 따라서 정규화기(regularizer)는 용량 대신 확률성을 희소화합니다. 우리는 선형 시간 내에 검증 가능하고, 실패할 경우 최소한의 복구 방안을 제공하는 보편 조건부 밀도 근사 증명서를 제시합니다. 나아가, 일부 매개변수를 샘플링하고 나머지를 최적화하는 일반적인 하이브리드 방식이 Type-II 최대 사후 확률(maximum a posteriori) 목적 함수에 대한 확률적 근사치이며, 결합된 스텝 크기(coupled step sizes)는 스텝 크기가 줄어들 때 사라지지 않는 추적 오차(tracking error)를 남길 수 있음을 보여줍니다. 이분산 목표값(bimodal target)에서 학습된 분할은 모든 예산(budgets)에 걸쳐 제약 없는 참조 값과 가깝게 유지되며 임계값에 둔감합니다. 반면, 동일한 사전 스케일을 레이어 전반에 분포시키는 무작위 마스크는 최대 두 자릿수까지 성능이 떨어집니다. UCI 벤치마크에서 우리의 방법은 약 절반의 매개변수를 결정론적으로 유지하면서 완전히 확률적인 네트워크와 동등한 성능을 보입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기