
Nvidia의 새로운 합성 비디오 탐지기(Synthetic Video Detector), 최대 92%의 정확도로 가짜 AI 비디오 식별 가능
요약
Nvidia가 AI 생성 비디오를 최대 92%의 정확도로 식별할 수 있는 'Synthetic Video Detector(SVD)'를 출시했습니다. 이 도구는 Vision Transformer 기술을 활용해 프레임 단위의 미세한 아티팩트를 분석하여 가짜 영상을 탐지합니다.
핵심 포인트
- Nvidia SVD는 최대 92%의 높은 탐지 정확도를 제공함
- Meta의 DINOv2 및 DINOv3 Vision Transformer를 기반으로 작동
- 소셜 미디어 압축 환경에서도 82% 이상의 높은 성능 유지
- Nvidia NIM 마이크로서비스 형태로 제공되어 낮은 지연 시간 구현
우리는 인공지능 (AI)이 인터넷을 점점 더 지배하면서 실제 콘텐츠와 가짜 뉴스를 구별하기가 점점 더 어려워지는 시대에 살고 있습니다. 오늘날 여러분이 보는 모든 사진이나 비디오는 AI에 의해 생성되었을 수 있으며, 이를 드러내던 전통적인 표식들은 빠르게 사라지고 있습니다. 무언가가 AI로 만들어졌는지 식별하는 데 도움을 주는 도구들이 존재하며, AI 경쟁의 주요 수혜자로 꼽히는 Nvidia는 방금 'Synthetic Video Detector' (SVD)라고 불리는 자체 도구를 출시했습니다.
SVD는 회사의 AI for Media Private Access Program의 일부인 Nvidia Inference Microservice (NIM)이므로 일반 소비자에게 공개되어 있지는 않지만, 데모는 존재합니다. 어쨌든 SVD의 역할은 간단합니다. 비디오가 실제인지 아니면 AI를 사용하여 생성되었는지를 탐지하는 것입니다. 이 도구는 비디오를 대규모로 분석할 수 있으며, 프레임 단위로 분해하여 이상 징후를 포착합니다. 이는 컴퓨터 비전 컨퍼런스인 ICCV에서 수상 경력이 있는 최첨단 연구를 기반으로 합니다.
SVD는 비디오 파일을 전체로서 보는 대신, 각각 504x504 해상도를 가진 크롭된 프레임(cropped frames)으로 분할합니다. 그런 다음 이 프레임들은 Meta가 만든 두 개의 강력한 Vision Transformer인 DINOv2와 DINOv3를 통과합니다. Vision Transformer의 역할은 인간이 라벨링한 데이터 없이 패턴을 형성하는 법을 배우는 것입니다. 이들은 일반적으로 이미지 분류 (image classification), 이미지 검색 (image retrieval), 객체 탐지 (object detection), 그리고 깊이 추정 (depth estimation)에 사용됩니다.
따라서 프레임이 이러한 트랜스포머를 통과하면, 고유한 공간적 특징 (spatial features)이 빠르게 평가되며, 각 프레임에는 0에서 1 사이의 점수가 할당됩니다. 여기서 0은 완전히 실제인 이미지를 나타내고 1은 완전히 가짜인 이미지를 나타냅니다. 마지막에 점수들을 합산하여 평균을 내며, 이는 사용자에게 100점 만점의 백분율 점수를 바탕으로 비디오가 실제인지 여부를 알려줍니다.
이러한 방식을 통해 뉴스 통신사, 방송사 및 미디어 매체는 수신한 영상을 훨씬 더 빠르고 높은 확실성을 가지고 인증할 수 있습니다. SVD는 온라인에 업로드된 비디오의 결함이 가려질 수 있다는 점을 고려하여, 소셜 미디어 압축(Social media compression)의 현실에서도 작동하도록 설계되었습니다. 하지만 트랜스포머(Transformers)는 인간의 눈이 감지할 수 없는 패턴을 여전히 찾아낼 수 있으며, 표면적인 이상 징후를 넘어 내재적인 아티팩트(Artifacts)에 집중합니다.

하단 행의 점수를 확인하세요 (이미지 출처: Nvidia)
위의 AI GVD 벤치마크에서 볼 수 있듯이, 압축되지 않은 비디오는 여전히 가장 좋은 결과를 보여주며 SVD는 92%라는 놀라운 정확도를 나타냅니다. 15% 압축률에서는 모델의 정확도가 87%로 떨어지지만, 50% 압축률에서도 AI 생성 콘텐츠를 탐지하는 데 있어 82%라는 매우 인상적인 정확도를 달성합니다. 이 기술은 마이크로서비스(Microservice)이기 때문에 지연 시간(Latency) 또한 매우 낮아, Nvidia RTX GPU에서는 1080p 비디오를 단 22ms 만에, Nvidia 워크스테이션 모델에서는 30ms 만에 처리합니다.

(이미지 출처: Future)
그럼에도 불구하고, SVD는 NVENC 인코더를 필요로 하므로 B100과 같은 데이터센터용 카드는 이를 네이티브로 실행할 수 없습니다. Nvidia는 실시간 합성 비디오 탐지를 라이브 스트리밍 워크플로(Livestreaming workflows)에 도입하기 위해 이미 Wowza와 협력하고 있다고 밝혔습니다. 데모 버전은 현재 build.nvidia.com에서 체험해 볼 수 있지만, 클라우드에서 처리되기 때문에 시간이 오래 걸리고, 최대 파일 크기 제한이 100MB에 불과하며, 자주 타임아웃(Time out)이 발생할 수 있으니 주의하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기