GestureFAR: 흐름 자기회귀를 이용한 스트리밍 공동 발화 제스처 생성
요약
본 논문은 스트리밍 음성 기반의 자연스러운 공동 발화 제스처 생성을 위한 새로운 프레임워크 GestureFAR를 제안합니다. 기존 방식이 가진 이산적 토큰 압축으로 인한 사실성과 다양성 제한 문제를 해결하고자 했습니다. GestureFAR는 흐름 자기회귀(flow autoregression)와 트랜스포머 구조를 결합하여 인과적이면서도 연속적인 모션 잠재값 생성을 실시간으로 구현합니다.
핵심 포인트
- GestureFAR: 스트리밍 공동 발화 제스처 생성 프레임워크 제시
- 흐름 자기회귀(flow autoregression)를 통해 연속적이고 사실적인 움직임 표현 가능
- 토큰별 흐름 매칭 헤드와 증류 전략으로 실시간 지연 병목 현상 개선
- BEAT2 데이터셋 실험 결과, 품질과 낮은 지연 시간 모두에서 우수한 성능 입증
스트리밍 음성으로부터 자연스러운 공동 발화(co-speech) 제스처를 생성하는 것은, 사용자가 말하고 있는 동안 움직임을 만들어내야 하는 체현된 대화 에이전트(embodied conversational agents)에게 필수적입니다. 최근의 스트리밍 제스처 시스템들은 이산적인 모션 토큰(discrete motion tokens)에 대해 자기회귀(autoregressing)함으로써 온라인 생성을 가능하게 하지만, 이러한 설계는 고차원 연속 움직임을 유한한 코드북(codebooks)으로 압축하여 생성된 제스처의 사실성(realism)과 다양성(diversity)을 제한할 수 있습니다. 인과성(causality)과 연속적인 표현력(continuous expressiveness)을 모두 보존하기 위해, 우리는 스트리밍 공동 발화 제스처 생성을 위한 흐름 자기회귀 프레임워크인 extbf{GestureFAR}를 제안합니다. 첫째, GestureFAR는 트랜스포머(transformer)를 사용하여 스트리밍 오디오-모션 컨텍스트를 모델링하고, 토큰별 흐름 매칭 헤드(per-token flow-matching head)를 이용해 연속 분포로부터 다음 잠재값(latent)을 샘플링함으로써 인과적 연속 모션 잠재값에 대해 자기회귀합니다. 둘째, 우리는 가역적인 백본(causal backbone)을 고정하고 일관성 및 분포 매칭 목적 함수(consistency and distribution-matching objectives)를 사용하여 다단계 토큰별 흐름 헤드를 단일 네트워크 평가로 증류하는 헤드 전용 흐름 증류 전략(head-only flow distillation strategy)을 도입합니다. 이를 통해 모델은 토큰 인과성을 유지하면서 실시간 상호작용의 주요 지연 병목 현상(latency bottleneck)을 제거할 수 있습니다. BEAT2 데이터셋에 대한 실험 결과, GestureFAR는 스트리밍 기능을 갖춘 방법들 사이에서 품질-지연 시간 트레이드오프를 크게 개선하여, 강력한 제스처 품질을 보존하면서 실시간 토큰 인과적 생성을 가능하게 함을 보여줍니다. 프로젝트 페이지: https://andypinxinliu.github.io/GestureFAR
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기