CACFG: 곡률 인식 분류기 프리 가이던스 및 최적 제어
요약
본 논문은 확산 모델의 핵심 메커니즘인 Classifier-Free Guidance (CFG)를 연속 시간 최적 제어 문제로 재구성하고, 그 작동 원리와 한계를 분석합니다. 기존 CFG가 높은 가이던스 강도에서 품질과 다양성 트레이드오프 문제를 겪는 이유를 밝히고, 이를 해결하기 위해 곡률 인식 분류기 프리 가이던스(CACFG)를 제안했습니다.
핵심 포인트
- CFG를 최적 제어 문제로 재구성하여 작동 원리를 분석함.
- 높은 CFG 강도는 샘플링 경로의 무제한 이동을 허용해 품질 저하를 야기함.
- 곡률 인식 CFG(CACFG)는 제어 집합을 초구로 제한하여 안정성을 높임.
- CACFG는 일반 CFG 대비 우수한 생성 품질과 다양성 트레이드오프를 제공함.
확산 모델(Diffusion models)은 고정된 손상 과정(corruption process)을 역추적하는 방법을 학습하여 샘플을 생성합니다. 분류기 프리 가이던스(Classifier-Free Guidance, CFG)는 원하는 클래스나 프롬프트에 따라 이 과정을 조건화하는 표준 메커니즘입니다. CFG는 다양한 가이던스 강도(guidance strengths)로 적용될 수 있으며, 높은 강도는 이미지 품질과 조건부 정렬을 향상시키지만, 너무 높은 가이던스 강도는 이미지 품질과 다양성을 저하시킬 수 있습니다. 더욱이, CFG는 원칙적인 확산 샘플링 역학(diffusion sampling dynamics)을 위반하며, 이 위반에도 불구하고 작동하는 이유에 대한 기존 설명들은 근본적인 이론에 대해 의견 불일치를 보이거나 실제 사용되는 결정론적 샘플러(deterministic samplers)로 확장되지 않습니다. 우리는 이 두 가지 문제를 모두 다룹니다. 먼저, CFG 샘플링을 연속 시간 최적 제어 문제(continuous-time optimal control problem)로 구성하고, 샘플링 궤적을 원하는 조건을 최대화할 확률을 높이기 위해 선택된 일련의 제어(controls)로 간주합니다. 결과적으로 도출되는 Hamilton--Jacobi--Bellman 방정식을 풀면, 제약이 없는 제어 집합(unconstrained control set)을 사용할 때 특정 경로 비용(path costs) 하에서 CFG가 복원됨을 보여줍니다. 우리는 이러한 제약의 부재가 높은 가이던스 강도에서의 CFG 실패 원인이라고 주장합니다. 왜냐하면 이는 샘플링 경로가 현재 이미지 추정치로부터 임의로 멀리 이동할 수 있도록 허용하기 때문입니다. 이를 수정하기 위해, 우리는 곡률 인식 CFG(Curvature-Aware CFG, CACFG)를 제안하며, 이는 변분 오토인코더(variational autoencoders) 훈련 시 사용되는 가우시안 정규화(Gaussian regularisation)에 의해 알려진 초구(hypersphere)로 제어 집합을 제한합니다. 우리는 CFG 샘플링으로 생성된 제어 입력이 이 경계를 일상적으로 위반하며, 확산 모델, 데이터셋, 그리고 가이던스 스케줄 전반에 걸쳐 CACFG가 일반적인 CFG보다 덜 심각한 품질-다양성 트레이드오프(quality-diversity tradeoff)를 가지면서도 중간에서 높은 가이던스 강도에서 우수한 생성 품질을 달성함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기