혼잡한 장면에서의 깊이 가이드 기반 비디오 객체 카운팅 (Depth-Guided Video Object Counting in Crowded
요약
본 논문은 혼잡하고 폐쇄된 장면에서의 비디오 객체 카운팅 기술을 개선하기 위해 Depth-Guided Detector (DG-Det)를 제안합니다. 깊이 단서와 멀티 스케일 RGB-D 교차 주의 집중, 명시적 폐쇄 예측 등을 통합하여 공간 이해도를 높였습니다. 또한 중복 제거 프레임워크와 새로운 데이터셋을 공개하며 성능 향상을 입증했습니다.
핵심 포인트
- 깊이 가이드 탐지기(DG-Det)를 제안하여 혼잡한 장면의 객체 카운팅 정확도 개선.
- RGB-D 교차 주의 집중 및 폐쇄 예측을 통해 공간적 이해도를 높임.
- 프레임 간 중복 제거 프레임워크를 도입하여 카운팅 신뢰성 확보.
- 새로운 RGB-D 비디오 객체 카운팅 데이터셋과 소스 코드를 공개함.
우리의 주요 목표는 혼잡한 장면에서의 비디오 객체 카운팅 (video object counting) 기술을 발전시키는 것이며, 주어진 텍스트 또는 시각적 프롬프트 (prompts)를 기반으로 대상 카테고리의 모든 인스턴스를 견고하게 카운팅하는 것을 목표로 합니다. 기존 방법들은 RGB 정보에 의존하기 때문에, 혼잡하고 폐쇄 (occluded)된 조건에서 판별 능력이 제한됩니다. 이를 해결하기 위해, 우리는 일반적인 후처리 파이프라인 (post-processing pipeline)과 함께 깊이 가이드 탐지기 (Depth-Guided Detector, DG-Det)를 제안합니다. 멀티 스케일 RGB-D 교차 주의 집중 (multi-scale RGB-D cross-attention) 및 명시적인 폐쇄 예측 (occlusion prediction)을 통해 깊이 단서 (depth cues)를 통합함으로써, 우리의 방법은 공간적 이해를 향상시키고 혼잡하고 폐쇄된 장면에서 견고한 탐지를 달성합니다. 또한, 프레임 간 중복 카운팅을 제거하기 위해 통합된 중복 제거 프레임워크 (de-duplication framework)를 도입합니다. 향후 연구를 촉진하기 위해, 깊이 정보와 시퀀스당 여러 객체 카테고리를 특징으로 하는 새로운 RGB-D 비디오 객체 카운팅 데이터셋을 공개합니다. 광범위한 실험을 통해 우리의 방법이 기존 베이스라인 (baselines)과 비교하여 MAE를 62.01% 감소시켰으며, RMSE에서도 일관된 개선을 보여줌을 입증했습니다. 우리는 소스 코드를 https://github.com/streamer-AP/DG-Net 에, 데이터셋을 https://huggingface.co/datasets/aerospace123/RGBD-VideoCount 에 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기