Action Units 및 Action-Detection 가이드를 통한 Text-to-Motion의 획(Stroke) 단위 시간 제어
요약
Text-to-motion 모델이 동작의 개별 획(stroke)을 정밀하게 제어할 수 있도록 Action Units(AUs) 개념을 도입한 연구입니다. 경량 게이트 어댑터와 훈련이 필요 없는 분류기 그래디언트를 통해 동작의 타이밍과 궤적을 획 단위로 정교하게 조절합니다.
핵심 포인트
- Action Units(AUs)를 통한 유형화된 시간적 이벤트 도입
- 경량 게이트 어댑터로 고정된 백본 모델에 AU 접지
- 훈련 없이 프레임 수준 탐지기로 잔차 타이밍 오류 보정
- StrokeBench를 통한 획 단위 제어 능력 검증 및 성능 향상
Text-to-motion (텍스트-모션 생성) 모델은 프롬프트가 명시하는 동작에는 능숙하지만, 각 획(stroke)이 언제 발생하는지에 대해서는 신뢰도가 낮습니다. 예를 들어, 좌우를 번갈아 가며 내지르는 네 번의 펀치는 네 개의 분리 가능한 획으로 나타나는 경우가 드뭅니다. 우리는 개별 획(그 신체 궤적, 동작 클래스, 시간 창, 충격 타이밍)을 명시적인 조건화 신호(conditioning signal)로 만드는 Action Units (AUs)라고 불리는 유형화된 시간적 이벤트(typed temporal events)를 도입합니다. 우리는 두 개의 스트림(획 단위 토큰(per-stroke tokens) 및 프레임 단위 위상 채널(per-frame phase channel))을 주입하는 경량 게이트 어댑터(lightweight gated adapter)를 통해, 고정된(frozen) text-to-motion 백본을 AU 세트에 접지(grounding)시키며, 추론 시에는 고정된 프레임 수준 탐지기(frame-level detector)로부터 얻은 훈련이 필요 없는(training-free) 분류기 그래디언트(classifier gradient)를 사용하여 잔차 타이밍 오류(residual timing errors)를 보정합니다. 우리는 프롬프트가 횟수, 순서, 궤적, 핵심 프레임 배치(core-frame placement)를 지정하고 검증된 획 코퍼스(stroke corpus)와 쌍을 이루는 StrokeBench를 통해 획 단위 제어 능력을 측정합니다. AU 접지는 가장 강력한 기존 인터페이스보다 정확하게 배치된 단일 획의 비율을 현저히 높였으며, 텍스트(text-), 구간(interval-), 프레임(frame-) 수준의 베이스라인들 중 최고의 모션 품질을 보여주었습니다. 프롬프트로 지정된 핵심 프레임(core frame)은 추가적으로 조종 가능한 축(steerable axis)으로 나타납니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기