강건한 합성 이미지 출처 식별을 위한 하이브리드 의미론적 및 스펙트럼 앙상블
요약
T2I 모델의 급격한 발전으로 인한 합성 이미지 출처 식별(SIA) 문제를 해결하기 위해 의미론적 딥러닝과 수학적 포렌식 특징을 결합한 앙상블 프레임워크를 제안합니다. 이 방식은 후처리 연산이 가해진 이미지에서도 높은 정확도를 보이며, CPU 환경에서도 실행 가능한 높은 효율성을 자랑합니다.
핵심 포인트
- 의미론적 분기와 수학적 포렌식 분기를 결합한 이중 앙상블 프레임워크 제안
- SVD 스펙트럼 프로파일 및 LBP 등 126개의 수학적 특징 활용
- ICANN 2026 DLMMDD 챌린지에서 95.60%의 높은 정확도 달성
- GPU 없이 표준 CPU만으로 실행 가능한 높은 계산 효율성 및 확장성 확보
텍스트-이미지 (text-to-image, T2I) 모델의 급격한 발전은 강건한 합성 이미지 출처 식별 (Synthetic Image Source Attribution, SIA) 방법론을 필요로 하게 만들었습니다. SIA의 핵심 과제는 깨끗한 학습 이미지와 JPEG 압축 및 블러링 (blurring)과 같은 미지의 후처리 연산을 거치는 실제 배포 이미지 사이의 분포 변화 (distribution shift)입니다. ICANN 2026의 DLMMDD 챌린지를 위해 제안된 본 연구에서는 의미론적 딥러닝 (Semantic Deep Learning)과 수학적 포렌식 특징 추출 (Mathematical Forensic Feature Extraction)을 결합한 이중 분기 앙상블 프레임워크를 소개합니다. 의미론적 분기(semantic branch)는 지수 이동 평균 (Exponential Moving Averaging, EMA) 및 레이블 스무딩 (Label Smoothing)으로 정규화된 EfficientNet-B0를 사용합니다. 포렌식 분기(forensic branch)는 고주파 노이즈 잔차 (high-pass noise residuals)로부터 SVD 스펙트럼 프로파일 (SVD spectral profiles) 및 국부 이진 패턴 (Local Binary Patterns)을 포함한 126개의 수학적 특징을 추출하며, 이는 절단된 SVD (Truncated SVD)를 통해 압축된 후 XGBoost로 분류됩니다. 테스트 세트의 55%가 저하된 10개의 생성기 데이터셋을 통해 평가했을 때, 우리의 접근 방식은 95.60%의 프라이빗 리더보드 정확도를 달성했습니다. 또한, 전체 파이프라인은 계산 효율성이 매우 높아 GPU 가속이 필요하지 않으며, 표준 CPU에서 6.5시간 이내에 엔드-투-엔드 (end-to-end)로 실행되어 실제 배포를 위한 수학적 포렌식의 실용성과 확장성을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.GR (Graphics)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기