Appearance Pointers — Diffusion Transformers의 멀티모달 영역 제어
요약
Diffusion Transformers(DiTs)에서 텍스트나 이미지 입력을 특정 마스크 영역에 정밀하게 정렬하는 'Appearance Pointers' 기술을 소개합니다. 모델을 재학습하지 않고도 공간적 배치와 재질을 제어할 수 있는 양식 불가지론적 인터페이스를 제공합니다.
핵심 포인트
- Appearance Pointers를 통한 DiT의 정밀한 영역 제어 구현
- 텍스트 및 이미지 입력을 사용자 지정 마스크와 정렬 가능
- 모델 재학습 없이 국소적 멀티모달 제어 인터페이스 도입
- 토큰 부하를 최소화하면서 여러 영역 설명 처리 가능
텍스트 프롬프팅만으로는 신뢰성 있게 달성할 수 없는 재질, 객체 정체성, 공간적 배치에 대한 정밀한 영역 제어가 필요한 창의적인 전문가들에게 제어 가능한 이미지 생성은 여전히 어려운 과제로 남아 있습니다. Diffusion Transformers (DiTs)는 텍스트와 이미지에서 유래하는 이질적인 토큰 (heterogeneous tokens)을 기본적으로 수용할 수 있지만, 이러한 토큰이 어디에서 어떻게 출력에 영향을 미쳐야 하는지를 결정하는 메커니즘이 부족합니다. 우리는 텍스트 또는 이미지 입력을 사용자가 지정한 마스크 (masks)와 정렬함으로써, DiTs가 올바른 공간 위치에서 올바른 외형 단서 (appearance cues)를 따르도록 안내하는 압축된 토큰인 appearance pointers를 소개합니다. Appearance pointers는 영역 대응 네트워크 (region correspondence network)에 의해 생성되고 공간 집계 메커니즘 (spatial aggregation mechanism)을 통해 정제되며, 이를 통해 모델은 토큰 부하를 크게 증가시키지 않고도 여러 영역 설명을 처리할 수 있습니다. 우리의 접근 방식은 기본 모델을 처음부터 다시 학습시키지 않고도 DiT 내에서 국소적인 멀티모달 제어를 위한 최초의 양식 불가지론적 (modality-agnostic) 인터페이스를 도입합니다. 다양한 지표에 걸쳐, 우리의 단일 모델은 양식 특정적 (modality-specific) 최신 기술 (state of the art)의 성능에 도달하거나 이를 능가하며, 생성적 이미지 합성에서 정밀하고 영역을 인식하는 멀티모달 가이드를 향한 단순하고 확장 가능한 경로를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기