Weave Mamba Fusion: 경량 얼굴 탐지를 위한 전역 크로스 스케일 상호작용
요약
본 논문은 얼굴 탐지 성능 향상을 위해 전역 크로스 스케일 의존성을 모델링하는 Weave Mamba Fusion (WMF)을 제안합니다. WMF는 인접한 피처 피라미드 스케일을 열별(column by column)로 엮어 효율적으로 정보를 교환하며, 이를 적용한 WeaveFace 탐지기는 적은 파라미터와 낮은 연산량으로 높은 성능을 달성했습니다.
핵심 포인트
- WMF는 전역 크로스 스케일 의존성을 모델링하여 얼굴 탐지를 개선합니다.
- 열별 엮기(Weaving) 방식을 통해 피처 구조를 보존하며 효율적인 상호작용이 가능합니다.
- WeaveFace는 적은 파라미터와 낮은 연산량으로 높은 평균 AP를 달성했습니다.
FPN부터 BiFPN에 이르기까지 피처 피라미드 방법(Feature pyramid methods)은 다중 스케일 특징을 융합하여 얼굴 탐지에서 강력한 성능을 달성했습니다. 그러나 작은 스케일, 가려짐(occlusion), 극단적인 포즈와 같은 비제약적 조건 하의 얼굴 탐지는 여전히 어렵습니다. 이는 국소적 융합으로는 모델링할 수 없는 전역 크로스 스케일 의존성을 요구하기 때문입니다. Mamba와 같은 상태 공간 모델(State space models)은 특징을 시퀀스로 스캔하여 선형 복잡도로 전역적인 컨텍스트를 제공하므로, 이 문제에 대한 유망한 방향을 제시합니다. 그럼에도 불구하고, 이러한 스캔은 두 피라미드 스케일을 단일 피처 맵으로 결합해야 하며, 그 조합 방식이 크로스 스케일 구조가 보존되는지를 결정합니다. 합산(Summation)은 스캔 전에 두 스케일을 축소시켜, 스캔이 활용할 수 있는 크로스 스케일 구조를 갖지 못하게 하는 반면, 연결(Concatenation)은 두 스케일을 유지하지만 훨씬 높은 비용을 초래합니다. 이를 해결하기 위해, 우리는 인접한 두 피라미드 스케일을 열별(column by column)로 엮는 extbf{Weave Mamba Fusion (WMF)}을 제안합니다. WMF는 수평 양방향 SS2D 스캔의 각 단계가 한 스케일에서 다른 스케일로 이동하도록 하여, 부분 채널 처리와 파라미터 프리 디-위빙(parameter-free de-weaving)을 통해 효율적인 크로스 스케일 상호작용을 가능하게 하면서 피처 구조를 보존합니다. WMF를 모든 융합 노드에 통합하여 extbf{WeaveBiFPN}을 얻었으며, 이는 우리의 extbf{WeaveFace} 탐지기의 목(neck) 부분입니다. WIDER FACE 데이터셋에서 WeaveFace는 단 0.34M 파라미터와 1.16 GFLOPs로 91.41%의 평균 AP를 달성하여, 0.5M 파라미터 미만의 이전 탐지기를 능가합니다. 가장 큰 성능 향상은 'Hard' 서브셋에서 나타나며, 여기서 87.14%의 AP에 도달했습니다. 코드는 ext{https://github.com/dohun-mat/WeaveMambaFusion}에서 공개적으로 이용 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기