O-VAD: 객체 중심 추적 및 추론을 통한 산업용 비디오 이상 탐지 (Industrial Video Anomaly Detection)
요약
산업용 비디오 이상 탐지(IVAD)를 위해 객체의 상태 변화를 추적하는 학습이 필요 없는 에이전트 기반 프레임워크인 O-VAD를 제안합니다. 이 방법은 도메인 지식 주입 없이도 객체의 시공간적 역동성을 추적하여 비정상 객체를 식별하며, 기존 VLM 및 미세 조정된 모델보다 뛰어난 성능을 보입니다.
핵심 포인트
- 학습이 필요 없는 에이전트 기반 프레임워크 제안
- 객체의 시공간적 역동성 및 상태 진화 추적
- 도메인 특화 지식 없이도 산업 환경 적용 가능
- 기존 VLM 및 미세 조정 모델 대비 우수한 성능 입증
- 이상 프로세스에 대한 해석 가능한 보고서 제공
산업용 비디오 이상 탐지 (Industrial Video Anomaly Detection, IVAD)는 산업 공정 내의 비정상적인 객체와 이벤트를 식별하는 것을 목표로 하며, 이는 현대의 제조 및 품질 관리 시스템에서 매우 중요합니다. 기존의 VLM (Vision-Language Model) 기반 이상 추론 방법들은 일반적인 도메인에서 개방형 이상 징후를 탐지할 수 있습니다. 그러나 복잡한 객체 변형, 엄격한 물리 법칙, 그리고 절차적 제약이 특징인 산업 환경에서는 성능이 저하됩니다. 이러한 상호작용 집약적 탐지의 복잡성을 해결하기 위해, 우리는 인간 검사사처럼 객체의 상태 진화 (object state evolution)를 강조하며, 도메인 특화 지식 없이도 작동하는 학습이 필요 없는 에이전트 기반 프레임워크 (training-free agentic framework)를 소개합니다. 이 프레임워크는 시간이 지남에 따라 탐지된 객체의 시공간적 역동성 (spatial-temporal dynamics)과 근본적인 변형을 추적하도록 설계되었으며, 이후 객체별 시간 상태 궤적 (object-wise temporal state trajectories)을 추론하여 근거가 있는 프레임 (grounded frames) 내에서 비정상 객체를 식별합니다. 우리의 방법은 정상 클립에 대한 재학습에 의존하거나 테스트 시 추론을 위한 컨텍스트로 도메인 지식을 주입해야 했던 이전 접근 방식들의 한계를 극복합니다. 세 가지 IVAD 데이터셋에 대한 광범위한 실험을 통해, 우리의 방법이 최첨단 VLM, 에이전트 기반 프레임워크, 그리고 각 데이터셋에 맞춰 미세 조정된 전통적인 VAD (Video Anomaly Detection) 방법들보다 뛰어난 성능을 보임을 입증하였으며, 이상 프로세스 및 유형에 대한 해석 가능한 보고서를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기