전문가 검증 데이터와 경량 어텐션 기반 모델을 활용한 배포 가능한 방글라 수어 인식 연구
요약
방글라 수어(BdSL) 인식을 위해 전문가가 검증한 RSBdSL38 데이터셋과 경량 어텐션 기반 컨볼루션 네트워크를 제안합니다. 이 모델은 매우 적은 파라미터로도 높은 정확도를 기록하며, 온디바이스 배포에 최적화된 성능을 보여줍니다.
핵심 포인트
- 전문가가 검증한 10,874개의 방글라 수어 이미지 데이터셋 RSBdSL38 공개
- 298,470개의 파라미터만 사용하는 초경량 어텐션 기반 모델 설계
- 사전 학습된 모델 대비 파라미터 수 최대 68배, 연산량 최대 21.7배 절감
- 스마트폰 환경에서 이미지당 3.98ms의 빠른 추론 속도 및 높은 정확도 달성
방글라데시의 청각 장애인들은 주로 방글라 수어 (Bangla Sign Language, BdSL)를 통해 의사소통합니다. 개인용 기기에서 자동화된 BdSL 인식이 가능해진다면 교육 및 서비스에 대한 접근성을 넓힐 수 있습니다. 기존 시스템들은 전문가의 검증이 없는 통제된 환경의 데이터셋을 사용하며, 온디바이스 (on-device) 사용에 부적합한 무거운 사전 학습된 백본 (pretrained backbones)을 사용합니다. 우리는 방글라 알파벳의 51개 문자를 나타내는 38개의 모든 BdSL 수형을 아우르는, 전문가가 검증한 10,874개의 이미지로 구성된 RSBdSL38을 소개합니다. 이 데이터는 방글라데시 전역의 3개 특수학교에서 실제 수어 사용자로부터 기록되었습니다. 우리는 그룹화된 병목 잔차 블록 (grouped bottleneck residual blocks), 채널 및 공간 어텐션 (channel and spatial attention), 다중 스케일 심층 수형 특징 블록 (multi-scale depthwise hand-feature block), 이중 풀링 (dual pooling), 그리고 Swish 활성화 함수 (Swish activations)로 구축된 298,470개의 파라미터를 가진 경량 어텐션 기반 컨볼루션 네트워크를 제안합니다. 처음부터 (from scratch) 학습했을 때, 이 모델은 96.37%의 정확도 (5개 시드 기준 95.72% ± 0.54%)를 달성하였으며, 이는 동일한 프로토콜 하에서 9개의 ImageNet 사전 학습된 효율적인 아키텍처 중 최고 성능과 비교했을 때 1.08% 포인트 차이 이내이며, 파라미터 수는 8.5배에서 68배 적고, 연산량 (MACs)은 1.3배에서 21.7배 적습니다. 재학습 시, 6개의 공개 BdSL 벤치마크에서 92.95%98.33%, 병합된 코퍼스 (merged corpus)에서 97.04%, BdSL-38에서 76.25%의 제로샷 (zero-shot) 성능을 기록했습니다. 아키텍처의 어떤 단계를 제거하더라도 정확도가 7.6189.30포인트 하락하는 반면, 학습 레시피 (training recipe)의 영향은 최대 3.17포인트에 불과했습니다. 삭제-삽입 (deletion-insertion) 및 가중치 무작위화 (weight-randomization) 체크를 포함한 Grad-CAM 분석을 통해 예측이 수어 동작을 수행하는 손을 따르고 있음을 확인했습니다. 36명의 수어 사용자 중 6명을 제외한 사용자 독립적 분할 (signer-independent split) 테스트에서는 85.18%를 기록했습니다. 0.48 MB로 양자화 (Quantized)된 이 모델은 일반 스마트폰에서 15.5 MB의 점유 공간 내에 이미지당 3.98 ms의 속도로 실행됩니다. RSBdSL38과 우리의 처음부터 학습시킨 모델은 벤치마크 정확도를 사전 학습된 백본 비용의 극히 일부만으로 배포 가능한 접근성으로 전환합니다. 데이터셋, 코드 및 모델은 공개되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기