Vision Transformer를 이용한 카메라 공간에서의 정확한 손 자세 추정
요약
본 논문은 단안 RGB 기반 카메라 공간 손 자세 추정의 두 가지 근본적인 문제(깊이 모호성 및 국소/전역 자세 결합 효과)를 해결하는 새로운 프레임워크를 제안합니다. 변환 동형성 감독과 원근 정보 임베딩을 통합하여 정확도를 높였으며, CS-MJE에서 SOTA 대비 37.1%의 성능 향상을 달성했습니다.
핵심 포인트
- 단안 RGB 기반 손 자세 추정의 어려움(깊이 모호성) 해결
- 변환 동형성 감독 및 원근 정보 임베딩 도입
- 국소/전역 자세 결합 효과를 통합적으로 처리하는 아키텍처 제시
- CS-MJE 벤치마크에서 높은 성능 우수성 입증
단안 RGB 기반의 손 자세 추정은 컴퓨터 비전 분야에서 중요한 연구 영역으로 부상했습니다. 국소적인(local) 손 자세 추정 방법들은 손목에 상대적인 손 자세를 예측하는 반면, 전역적인(global) 손 자세 추정은 카메라 좌표계 내에서 손목의 위치를 추정할 것을 요구합니다. 하지만 이러한 카메라 공간에서의 추정은 두 가지 근본적인 문제에 직면합니다: (1) 단안 설정에서의 깊이 모호성(depth ambiguity), 그리고 (2) 원근 투영(perspective projections)에서 발생하는 손 국소 자세와 전역 손목 위치의 결합 효과(coupling effect)입니다. 특히, 이러한 결합은 투영 자체가 국소 손 자세, 손목 위치, 카메라 내부 파라미터에 의해 공동으로 결정됨을 반영합니다. 이러한 문제들을 극복하기 위해, 저희 프레임워크는 두 가지 핵심 혁신을 제안합니다: 손-깊이 정보 추출을 위한 변환 동형성 감독(Transformation-Isomorphism Supervision)과 국소 자세 및 손목 위치의 상기 결합 효과를 해결하기 위한 원근 정보 임베딩(Perspective Information Embedding)입니다. 이 두 요소는 모두 주류 인코더-디코더 아키텍처 내에 통합됩니다. 게다가, 저희는 순차적인 자세 정제를 위한 새로운 프레임률 인식 다중 데이터셋 훈련 전략을 제안합니다. 저희의 완전히 통합된 접근 방식은 HO3D에서 SOTA(State-of-the-Art) 대비 CS-MJE에서 최대 37.1%의 우수성을 달성했습니다. 프로젝트 페이지: https://github.com/Mine268/CS-ViT.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기