확산 모델(Diffusion Models) 내의 의사 난수 스트림(Pseudorandom Streams)은 생성 품질에 영향을 미치는 학습
요약
확산 모델에서 사용하는 의사 난수 스트림이 모델의 학습과 생성 품질에 결정적인 영향을 미친다는 연구 결과입니다. 의사 난수의 결정론적 궤도 구조가 모델의 입력으로 작용하여 손실 함수와 생성 결과에 변화를 줄 수 있음을 입증했습니다.
핵심 포인트
- 의사 난수의 결정론적 궤도 구조가 학습 가능한 입력으로 작용함
- 난수 패턴의 예측 가능성이 확산 모델의 손실 및 생성 품질에 영향
- MNIST 및 CIFAR-10 실험을 통해 난수 소스의 구조적 영향 확인
- 프로브 손실과 확산 손실 사이의 경험적 멱법칙 관계 발견
확산 모델(Diffusion models)은 확률적 입력(stochastic inputs)에 의존하지만, 유한 정밀도 하드웨어(finite-precision hardware)에서 모델이 소비하는 "무작위성(randomness)"은 의사 난수 규칙(pseudorandom rules)에 의해 생성된 결정론적 수치 궤도(deterministic numerical orbits)로 실현됩니다. 접근 가능한 궤도 구조(orbit structure)는 학습 가능한 입력이 될 수 있으며, 실현된 손실(loss)과 그 그래디언트(gradient)가 각 최적화 단계(optimization step)에서 소비되는 구체적인 의사 난수 값에 의존하기 때문에 훈련(training)과 생성(generation) 모두에 영향을 미칠 수 있습니다. 작은 다층 퍼셉트론(multilayer perceptron, MLP)은 최근 이력을 통해 궤도의 다음 값을 예측하며, 이를 통해 일반적인 시퀀스 예측 가능성(sequence predictability)을 측정합니다. 확산 프로브(diffusion probe)는 확산 아키텍처(diffusion architecture)와 훈련 목적 함수(training objective)를 유지하면서 실제 이미지를 온라인 난수 텐서(online random tensors)로 대체하여, 대상 시스템이 궤도 구조를 활용할 수 있는지 측정합니다. 주변 통계량(marginal statistics)을 제어하고 명백한 동역학적(dynamical) 및 유한 정밀도 실패를 걸러낸 후에도, 남은 궤도들은 MNIST 및 CIFAR-10에서 현저히 다른 확산 손실(diffusion losses)과 생성 품질을 생성합니다. 두 측정 지표 모두 국소적 순위(local rankings)는 다르지만, 거시적인 생성 저하(macroscopic generation degradation)와 강한 순위 상관관계(rank correlations)를 보입니다. IID 베이스라인(IID baseline)에 의한 정규화 이후, 프로브 손실(probe loss)과 실제 데이터 확산 손실(real-data diffusion loss)은 두 데이터셋에서 서로 다른 지수(exponents)를 가지며 경험적 멱법칙(empirical power law)을 대략적으로 따릅니다. 이러한 결과는 의사 난수 소스(pseudorandom source)가 단순히 분포적 선택(distributional choice)일 뿐만 아니라, 모델 의존적인 구조적 입력(model-dependent structured input)임을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기