그림을 그리기 전에 생각하기: 확산 모델을 위한 재귀적 잠재 추론
요약
본 논문은 확산 모델이 시각적 추론 작업에 취약하다는 문제를 해결하기 위해 PaTh(Painter-Thinker)를 제안합니다. PaTh는 작은 재귀 네트워크(The Thinker)가 노이즈 이미지와 조건화 정보 위에서 잠재 상태를 정제하고, 고정된 확산 모델(The Painter)을 ControlNet으로 유도하여 추론 능력을 픽셀 공간에 통합합니다.
핵심 포인트
- PaTh는 재귀적 네트워크로, 시각적 추론 작업을 수행합니다.
- MNIST 스도쿠 퍼즐에서 이전 최고 기록 대비 높은 성능을 달성했습니다.
- 기호 기반의 추론 메커니즘을 픽셀 공간 확산 모델에 통합하는 방법을 제시합니다.
확산 모델(Diffusion models)은 사실적인 이미지를 생성하지만, 스도쿠 채우기나 미로를 통과하는 경로 그리기와 같은 시각적 추론 작업에서는 종종 실패합니다. 이산 기호 표현(discrete symbolic representation)이 사용 가능할 때, Tiny Recursive Model (TRM)과 같은 재귀적 방법은 이러한 퍼즐의 어려운 인스턴스조차 해결합니다. 우리는 이러한 추론 능력을 기호 표현이 없는 픽셀 공간으로 어떻게 가져올 수 있을지 질문합니다. 우리는 Painter-Thinker (PaTh)를 제안합니다: PaTh는 작은 재귀 네트워크(The Thinker)로, 노이즈가 포함된 이미지와 조건화 정보를 인코딩한 토큰 그리드 위에서 추론하며, 모든 디노이징 단계 내에서 잠재 상태를 정제하고, 고정된 확산 모델(The Painter)을 ControlNet 어댑터를 통해 유도합니다. The Thinker는 기호 대상이나 솔버(solver), 검증기(verifier) 없이 표준 재구성 손실(reconstruction loss)만으로 훈련됩니다. PaTh는 92.5%의 어려운 MNIST 스도쿠 퍼즐(이전 최고 기록 75%)과 71.2%의 극한 난이도 퍼즐(이전 최고 기록 4.1%)을 해결하며, 표준 확산 모델 대비 10M 파라미터로 작동합니다. 또한 미로, 여왕 배치(Queens), 그리고 지정된 공간적 관계를 가진 CLEVR 장면에서도 성능을 개선하며, 문제 크기가 커질수록 그 우위가 증가합니다. 진단 실험은 PaTh가 확산 모델이 복구할 수 없는 주입 오류로부터 회복함을 보여주며, 특히 여러 셀이 잘못되었을 때 두드러집니다. 종합적으로, 이러한 결과들은 기호 데이터에 대해 개발된 추론 메커니즘이 기호 감독 없이 픽셀 공간의 확산 모델에 통합될 수 있음을 보여주며, 점점 더 복잡해지는 제약 조건 하에서 데이터를 생성할 수 있는 길을 열어줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기