HCIG: 멀티모달 풍자 및 사이버불링 탐지를 위한 계층적 교차 모드 불일치 그래프 네트워크
요약
텍스트와 시각 정보 간의 불일치를 활용해 멀티모달 풍자 및 사이버불링을 탐지하는 HCIG 프레임워크를 제안합니다. 그래프 어텐션 네트워크를 통해 토큰, 구, 전역 수준의 계층적 의미 불일치를 모델링하여 기존 방식보다 정교한 추론을 수행합니다.
핵심 포인트
- 계층적 교차 모드 불일치 그래프 네트워크(HCIG) 제안
- 그래프 어텐션 네트워크를 통한 다중 세분성 불일치 모델링
- MMSD 및 MultiBully 데이터셋에서 최고 성능 달성
- 모순 인식 풀링을 활용한 GCCN 아키텍처 소개
멀티모달 풍자(sarcasm) 및 사이버불링(cyberbullying) 탐지는 의도된 의미가 텍스트와 시각 정보 간의 불일치에서 나오는 경우가 많아, 단일 모달리티만으로는 파악하기 어렵기 때문에 여전히 어려운 과제입니다. 기존의 멀티모달 접근 방식들은 주로 특징 융합(feature fusion)이나 교차 모드 어텐션(cross-modal attention)에 의존하는데, 이는 다양한 표현 수준 전반에 걸친 계층적 의미 불일치(hierarchical semantic inconsistencies)를 효과적으로 포착하지 못할 수 있습니다. 이러한 한계를 해결하기 위해, 본 논문은 HCIG (Hierarchical Cross-modal Incongruity Graph Network)라는 새로운 프레임워크를 제안합니다. 이 프레임워크는 그래프 어텐션 네트워크(graph attention networks)를 사용하여 토큰, 구(phrase), 그리고 전역 수준에서 교차 모드 불일치성을 모델링하고, 학습된 계층적 어텐션 메커니즘(learned hierarchical attention mechanism)을 통해 이러한 표현들을 적응적으로 통합합니다. 보완적인 아키텍처로, 우리는 GCCN (Graph-based Cross-modal Contradiction Network)도 소개하는데, 이는 모순 인식 풀링(contradiction-aware pooling)을 사용하여 그래프 기반 추론을 수행함으로써 효율적인 멀티모달 상호작용 학습을 수행합니다. 제안된 모델들은 MMSD 풍자 벤치마크와 MultiBully 사이버불링 데이터셋에서 종합적인 제거 연구(ablation studies) 및 교차 작업 전이 실험과 함께 평가되었습니다. 실험 결과는 HCIG가 MMSD에서 85.74%의 정확도와 85.29%의 macro-F1로 최고의 성능을 달성했으며, GCCN은 MultiBully에서 가장 높은 macro-F1 (68.66%)을 기록하고, HCIG는 가장 높은 정확도(69.62%)와 불링 클래스 F1(74.90%)을 달성했음을 보여줍니다. 이러한 발견들은 계층적 다중 세분성 불일치 모델링이 기존의 융합 전략보다 더 효과적인 멀티모달 추론을 제공하며, 소셜 미디어에서의 풍자 및 사이버불링 탐지를 위한 강력한 프레임워크를 제공함을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기