음성 기반 3D 얼굴 애니메이션을 위한 공조화(Coarticulation)의 기하학적 측정
요약
본 논문은 음성 기반 3D 얼굴 애니메이션에서 공조화(coarticulation)의 기하학적 측정치인 '입술 경로 길이(lip-path length)'를 제안합니다. 이 측정치는 단순한 종점 현을 넘어 필수적인 이동과 퇴행성을 고려하여, 실제 음성의 조음 과정을 더 정확하게 포착하는 것을 목표로 합니다.
핵심 포인트
- '입술 경로 길이'는 공조화를 반영한 3D 얼굴 애니메이션의 새로운 기하학적 측정치입니다.
- 이 측정치는 강제 정렬만으로 적용 가능하여 참값이 필요 없는 환경에서도 유용합니다.
- 기존 모델(DiffPoseTalk, ARTalk 등)은 실제 음성 대비 조음 구성 요소가 과도하게 제거되는 결함을 보였습니다.
- 시청자 연구 결과는 자연스러운 움직임의 제어된 감쇠보다 과장이 더 선호됨을 시사했습니다.
음성 기반 3D 얼굴 애니메이션은 인식 가능한 입 모양을 재현할 수 있습니다. 하지만, 이는 그 사이의 움직임을 단순화할 수 있으며, 이 움직임에는 공조화(coarticulation), 즉 주변 음소가 각 음소의 조음 방식을 형성하는 방식이 담겨 있습니다. 우리는 이러한 궤적 형성의 기하학적 측정치인 입술 경로 길이(lip-path length)를 도입합니다. 이는 특정 음성 세그먼트의 모음, 자음, 모음 위치를 통과하는 최단 경로와 비교됩니다. 종점 현(endpoint chord)과는 달리, 이 자음 인지형 경로는 필수적인 이동을 고려하고 퇴행성을 피하며, 균일한 움직임 게인에 대한 불변성을 유지합니다. 이 측정치는 강제 정렬(forced alignment)만 필요하므로, 실제 참값(ground truth)이 존재하지 않는 곳에도 적용할 수 있습니다. 우리는 아키텍처 계열별로 각각 실시간 및 오프라인 네 가지 최첨단 방법론에 대해 이를 입증했습니다. 네 가지 모두 포착된 음성보다 더 평탄한 입술 궤적을 추적합니다. 프레임 속도와 일치하는 참값과 비교했을 때, DiffPoseTalk, ARTalk, FaceFormer는 명확한 결함을 보였는데, 이는 이 측정치로 볼 때 실제 음성의 빠른 조음 구성 요소의 15~60%를 제거한 것과 동등합니다. CodeTalker는 주 측정치에서는 미미하고 보조 측정치에서는 분명했습니다. 97명의 시청자와 3,523건의 판단을 거친 사전 등록 연구는 측정된 방향을 뒷받침합니다: 실제 움직임의 제어된 감쇠(damping)는 점수를 낮추고 패널티를 받지만, 과장(exaggeration)은 테스트 범위 내에서 아무런 감지된 패널티를 보이지 않았습니다. 시청자들은 문장 비교의 73.4%와 전체적으로 단일 단어에서도 실제 음성을 선호했습니다. 종합적으로 볼 때, 이 측정치, 그 교정(calibration), 그리고 연구는 지각적으로 관련 있는 궤적 형성의 손실과 합성된 조음 개선을 위한 구체적인 목표를 식별합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기