StreamTalk: 키 포즈 앵커링(Key-Pose Anchoring)을 이용한 스트리밍 Co-Speech 제스처 생성
요약
StreamTalk은 실시간 Co-Speech 제스처 생성 시 발생하는 드리프트 현상을 해결하기 위해 제안된 폐쇄 루프(closed-loop) 프레임워크입니다. 키 포즈 앵커링과 생성-검색-정제 사이클을 통해 긴 시퀀스에서도 안정적인 3D 모션을 생성합니다.
핵심 포인트
- 키 포즈 앵커링을 통해 스트리밍 모션의 드리프트 현상 억제
- 생성-검색-정제 사이클을 갖춘 폐쇄 루프 프레임워크 제안
- 확률적 앵커 마스킹을 통한 희소 경계 조건에서의 모션 복구 학습
- 파트 인식 DiT를 활용하여 전역 변위와 국부 관절 움직임 간섭 감소
- 76 FPS의 실시간 속도로 최첨단(SOTA) 성능 달성
실시간 Co-Speech (Co-Speech) 제스처 생성은 음성이 도착함에 따라 클립 단위로 3D 모션을 생성해야 합니다. 기존의 스트리밍 방식은 오픈 루프(open-loop) 방식입니다. 즉, 각 클립은 과거의 문맥(context)에 의존하지만, 모델은 자신의 궤적(trajectory)을 확인하거나 수정할 수 없습니다. 따라서 작은 오류들이 축적되어 긴 시퀀스 동안 드리프트(drift) 현상을 유발합니다. 우리는 이러한 실패가 짧은 클립의 품질 저하보다는 주로 전방 제약(forward constraint)의 부재로 인해 발생한다는 점을 관찰했습니다. 각 클립의 끝에 위치한 타당한 키 포즈(key pose)는 드리프트를 제한하는 목적지 앵커(destination anchor) 역할을 할 수 있습니다. 이러한 관찰을 바탕으로, 우리는 주기적인 생성-검색-정제(generate-retrieve-refine) 사이클을 갖춘 폐쇄 루프(closed-loop) 프레임워크인 StreamTalk을 제안합니다. 스트리밍 포즈 가이드 생성(Streaming Pose-Guided Generation)은 먼저 거친(coarse) 클립을 예측하고, 화자별 모션 데이터베이스에서 타당한 테일 포즈(tail pose)를 검색한 다음, 다음 윈도우(window)로 넘어가기 전에 이 포즈를 사용하여 클립을 정제합니다. 학습 과정에서는 확률적 앵커 마스킹(Stochastic Anchor Masking)을 통해 포즈와 이동(translation) 프레임을 무작위로 마스킹하여, 모델이 희소한 경계 조건(sparse boundary conditions)으로부터 완전한 모션을 복구하도록 학습시킵니다. 파트 인식 DiT(part-aware DiT)는 손, 몸, 이동 스트림을 분리하여 전역 변위(global displacement)와 국부적 관절 움직임(local articulation) 사이의 간섭을 줄입니다. BEAT2 데이터셋에서 StreamTalk은 최첨단(state-of-the-art) FGD를 달성하고, 오픈 루프 베이스라인 대비 장기 드리프트(long-horizon drift)를 줄였으며, 76 FPS의 실시간 속도로 실행됩니다. 프로젝트 페이지: https://xiangyue-zhang.github.io/StreamTalk/.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기