Soft Mask를 이용한 Diffusion 편집: 조절 가능한 강도로 이미지 및 비디오의 픽셀 단위 재작업
요약
Diffusion 모델 기반 편집은 픽셀 단위 제어에 어려움이 있었으나, 본 연구는 소프트 마스크(soft mask)를 활용하여 조절 가능한 강도로 이미지 및 비디오의 재작업을 가능하게 하는 SoftPaint를 제안합니다. 이 방법은 기존 인페인팅을 넘어 연속적인 스펙트럼의 편집을 구현하며, 기울기 계산이 필요 없는 샘플러를 통해 다양한 확산 모델에 적용 가능합니다.
핵심 포인트
- 소프트 마스크를 이용해 조절 가능한 강도로 이미지/비디오 재작업 가능
- SoftPaint는 기존 인페인팅을 넘어 연속적인 편집 스펙트럼 제공
- 기울기 계산이 필요 없고 메모리 효율적인 샘플러 설계
프롬프트와 참조 이미지를 안내하는 Diffusion 모델 기반 편집은 빠르게 발전해 왔지만, 여전히 픽셀 단위 제어에는 너무 거칩니다. 유망한 방향 중 하나는 공간적으로 변화하는 편집 강도를 지정하는 소프트 마스크(soft mask)를 통합하는 것입니다. 그러나 이러한 세밀한 제어를 학습시키려면 값비싼 픽셀별 주석이 필요하며, 기존의 제로샷(zero-shot) 방법들은 종종 만족스럽지 못한 결과를 가져옵니다. 우리는 소프트 마스크를 활용하여 원본 콘텐츠를 완전히 보존하는 것부터 마스킹된 영역을 완전히 재합성하는 것까지 연속적인 스펙트럼의 편집을 가능하게 하는 새로운 제로샷 샘플링 방법인 SoftPaint를 소개합니다. 기존의 제로샷 인페인팅(inpainting) 방법을 넘어, 우리는 픽셀별 소프트 마스크 강도를 존중하는 Langevin-iteration 기반 샘플러를 설계했으며, 이는 이미지 및 비디오 확산 모델에 보편적으로 적용되어 비디오 편집과 같은 작업을 가능하게 합니다. 이 방법은 기울기 계산이 필요 없고(gradient-free), 메모리 효율적이며, 여러 이미지 및 비디오 백본을 통해 부드럽고 픽셀 단위의 편집을 달성합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기