emg2face: 고밀도 표면 EMG를 이용한 표현적인 얼굴 애니메이션
요약
본 연구는 고밀도 표면 근전도(HD-sEMG)를 활용하여 얼굴 움직임을 포착하는 비광학적 방법을 제시합니다. 기존 광학 방식의 한계를 극복하며, 64개 채널의 EMG 데이터와 동기화된 안면 랜드마크 추정치를 기반으로 블렌드셰이프 파라미터를 예측합니다. 이를 통해 오직 sEMG 녹음만으로 실시간 애니메이션을 구현할 수 있습니다.
핵심 포인트
- HD-sEMG를 이용한 비광학적 얼굴 움직임 포착 가능
- 서브-밀리초 동기화 기술로 다중 모드 데이터 처리
- TCN 기반 신경망이 sEMG에서 블렌드셰이프 예측
- 실시간 애니메이션 구현으로 다양한 캐릭터에 적용
얼굴 움직임은 인간의 사회적 의사소통에 매우 중요한 미묘하고 필수적인 정보를 전달합니다. 안면 캡처를 위한 광학 방식은 가상현실(VR) 헤드셋과 같은 장치로 인해 얼굴이 가려질 경우 사용하기 어렵거나 불가능합니다. 시야가 확보된 경우에도, 이러한 방식은 사생활 침해 문제를 야기하며 카메라와 조명을 얼굴에서 벗어나게 하는 헤드마운트 캡처 장비를 필요로 합니다. 우리는 고밀도 표면 근전도 (HD-sEMG)가 이러한 문제들을 해결할 수 있는 실행 가능한 비광학적 대안임을 보여줍니다. 우리는 두 개의 직물 EMG 그리드를 사용하여 64개의 EMG 채널을 측정했으며, 이 중 32개는 이마(일반적으로 HMD에 의해 가려짐)에서, 나머지 32개는 얼굴 측면에서 측정했습니다. EMG 데이터는 2048 Hz로 디지털화 및 필터링되었습니다. 안면 움직임은 동시에 기록되었으며 MediaPipe의 Face Landmarker를 사용하여 478개의 3D 안면 랜드마크를 추정하는 데 사용되었습니다. 이러한 다중 모드 녹음에서 주요 과제 중 하나는 서로 다른 샘플링 주파수와 독립적인 클럭을 가진 EMG 데이터와 비디오 데이터를 동기화하는 것입니다. 우리는 서브-밀리초(sub-millisecond) 수준의 동기화가 가능한 아날로그 오디오 버스트를 사용하는 새로운 동기화 방법을 개발했습니다. 또한, 참가자들이 다양한 안면 표정을 수행하는 동안 최근 고해상도 파라메트릭 헤드 모델(GNM)에 253개의 아이덴티티 블렌드셰이프와 383개의 표현 블렌드셰이프를 피팅하는 단계적 피팅 방법을 개발했습니다. 우리는 그리드별 공간 인코더 뒤에 확장된 시간 컨볼루션 네트워크 (TCN)로 구성된 심층 신경망을 훈련시켜 HD-sEMG 신호로부터 100 Hz의 블렌드셰이프 파라미터를 예측하도록 했습니다. 일단 훈련되면, 이 네트워크는 오직 HD-sEMG 녹음만으로 표현 블렌드셰이프를 예측할 수 있습니다. 출력은 표준 실시간 블렌드셰이프 애니메이션 방법을 사용하여 렌더링될 수 있습니다. 우리는 25명의 참가자로부터 얻은 녹음을 사용하여 방법론을 시연하고, 다양한 인간 얼굴 및 비인간 캐릭터로의 직접적인 표정 전송을 수행했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기