현대적 VLM에서의 강력한 픽셀 수준 이미지 변조 탐지를 위한 단순한 도메인 일반화 (Domain Generalization)
요약
현대적 VLM이 생성한 이미지의 변조를 탐지하기 위한 도메인 일반화(Domain Generalization) 연구를 소개합니다. 균형 잡힌 미니배치 샘플링과 후기 주입 전략을 통해 새로운 VLM 분포에서도 견고한 픽셀 수준 변조 위치 탐지가 가능함을 입증했습니다.
핵심 포인트
- VLM 생성 이미지의 픽셀 수준 변조 탐지 성능 향상
- 균형 잡힌 미니배치 샘플링을 통한 학습 붕괴 방지
- 후기 주입(Late-injection) 전략으로 새로운 도메인 적응성 강화
- 기존 PIXAR 모델 대비 gIoU 및 cIoU 대폭 개선
현대적인 시각-언어 모델 (Vision-Language Models, VLMs)은 이미지 생성 및 편집 능력을 크게 향상시켰으며, 이로 인해 교차 모델(cross-model) 및 분포 외 (out-of-distribution, OOD) 변화 상황에서 픽셀 수준의 이미지 변조 탐지 (pixel-level image tampering detection)의 중요성이 커지는 동시에 그 난이도 또한 높아지고 있습니다. 본 연구는 ChatGPT, Gemini, Qwen-Image 등과 같은 현대적 VLM에서 픽셀 수준 이미지 변조 탐지를 위한 도메인 일반화 (domain generalization)를 연구하며, 다양한 VLM 생성 조작 분포 전반에서 견고함을 유지하는 변조 위치 탐지 (tampering localization) 모델을 학습하는 것을 목표로 합니다. 우리는 두 가지 실용적인 전략을 기반으로 구축된 단순하면서도 효과적인 도메인 일반화 학습 프레임워크를 제안합니다. 첫째, 각 미니배치(minibatch)에서 변조된 이미지와 실제 이미지를 전략적으로 샘플링하는 균형 잡힌 미니배치 샘플링 (balanced minibatch sampling) 기법을 도입합니다. 이는 조작된 아티팩트 (artifacts) 또는 깨끗한 이미지 사전 정보 (clean-image priors) 중 어느 한쪽으로 편향된 최적화를 방지하고 학습 붕괴 (training collapse)를 피하며, 각 최적화 단계가 적절하게 샘플링된 그래디언트 (gradient) 신호를 받을 수 있도록 보장합니다. 둘째, 우리는 단순한 후기 주입 (late-injection) 전략을 채택합니다. 이 전략에서는 탐지기를 먼저 대규모 기본 데이터로 안정적인 수렴이 이루어질 때까지 학습시킨 후, 새롭게 등장하는 VLM 분포에서 선택된 소량의 지원 데이터 (supporting data)에 노출시켜, 제한된 새로운 도메인에 과적합 (overfitting)되지 않으면서도 적응성을 향상시킵니다. 이러한 구성 요소들은 결합되어 현대적 VLM 전반에서 픽셀 수준 변조 위치 탐지 및 OOD 견고성을 개선하기 위한 단순하면서도 강력한 레시피를 제공합니다. 개념적인 단순함에도 불구하고, 우리의 프레임워크는 GPT-Images-2.0, Gemini-3.1, FLUX.2, Seedream 4.5와 같은 OOD VLM 환경에서 기존의 최첨단 기술인 PIXAR보다 평균 gIoU와 cIoU 측면에서 각각 26.1%와 26.8%라는 큰 폭의 상대적 개선을 달성했습니다. 우리의 코드는 https://github.com/VILA-Lab/PIXAR-DG 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기