DynaConTalk: 장편 및 제어 가능한 전반적인 동시 음성-입술 움직임을 위한 웨이블릿 제약 확산 모델
요약
본 논문은 장편적이고 제어 가능한 전반적인 동시 음성 동작 생성을 위한 웨이블릿 제약 확산 모델인 DynaConTalk을 제시합니다. 이 프레임워크는 정지파 변환(SWT) 계수 공간에서 작동하여, 거친 자세 변화부터 미세한 얼굴 디테일까지 시간적으로 분리된 밴드를 활용해 동작의 분산도를 높였습니다. 동적 게이팅 네트워크와 다양한 제어 메커니즘을 통해 리듬, 음향 특징 등을 선택적으로 통합하며 높은 품질과 제어성을 확보했습니다.
핵심 포인트
- 웨이블릿 제약 확산 모델(DynaConTalk)로 동작 생성의 분산도 및 제어성 향상.
- SWT 계수 공간 사용으로 거친 자세 변화와 미세 디테일 분리 가능.
- 동적 게이팅 네트워크를 통해 리듬, 멜 스펙트로그램 등 조건 선택적 통합.
- 참조 기반 제어(reference-guided control) 및 매치드 노이즈 제약 주입 구현.
전체적인 동시 음성 애니메이션은 동작 표현과 음성 조건화 모두에서 평균화되는 경향이 있습니다. 좌표 공간 확산(coordinate-space diffusion)에서는 느린 신체 자세, 중주파수 몸짓 스트로크, 그리고 빠른 손이나 얼굴 디테일이 하나의 예측 목표에 얽혀 있어 종종 분산도가 낮고 과도하게 부드러워진 동작을 생성합니다. 한편, 고정된 다중 모달 융합(multimodal fusion) 하에서는 밀집된 리듬 및 음향 단서가 희소한 콘텐츠별 정보에 지배적일 수 있습니다. 본 논문은 장편 및 제어 가능한 전반적인 동시 음성 동작 생성을 위한 웨이블릿 제약 확산 프레임워크인 DynaConTalk을 제시합니다. 확산 모델은 정지파 변환(stationary wavelet transform, SWT) 계수 공간에서 작동하며, 이 공간의 시간적으로 정렬된 밴드들은 거친 자세 변화, 몸짓 스트로크, 그리고 미세한 표현 디테일을 분리합니다. 저희의 동적 게이팅 네트워크(dynamic gating network)는 HuBERT와 화자 식별자(speaker identity)를 기반으로 보존하고, 동작 상태 및 노이즈 인식 잔차 게이트(motion-state- and noise-aware residual gates)를 통해 리듬, 멜(mel), 그리고 스크립트 특징을 선택적으로 추가합니다. 어텐션 풀링과 학습된 깊이 라우팅(learned depth routing)은 각 디노이징 단계에 보완적인 조건을 제공하며, 프레임 해상도 리듬 경로(frame-resolution rhythm path)는 정확한 타이밍을 유지합니다. 이후 부호화된 제안 합의 업데이트(signed proposal-consensus update)가 이러한 조건들을 진화하는 동작 상태와 조율합니다. 매치드 노이즈 제약 주입(Matched-noise constraint injection)은 히스토리 연속성 및 국소 키포즈 복구에 동일한 샘플링 인터페이스를 사용하며, 참조 기반 제어(reference-guided control)로 확장됩니다. 별도의 신체-손 및 얼굴 디노이저(denoiser)를 거친 후 역 SWT와 자세 구동 루트 회귀기(pose-driven root regressor)가 전체적인 동작을 생성합니다. 실험에서는 생성 품질, 얼굴 정확도, 시간적 연속성, 그리고 제어 가능한 편집 기능을 평가했습니다. 코드, 모델 및 인터랙티브 편집 인터페이스는 https://github.com/zhuyifeiabcd1/DynaConTalk에서 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기