DeBERTa-Sentinel: 투명하고 신뢰할 수 있는 AI 생성 텍스트 탐지를 향하여
요약
DeBERTa-v3의 분리된 어텐션을 활용하여 AI 생성 텍스트를 투명하게 탐지하는 DeBERTa-Sentinel 프레임워크를 소개합니다. 토큰 수준의 설명을 제공하여 탐지 결과의 해석 가능성을 높였으며, 다양한 LLM 생성물에 대해 높은 정확도와 재현율을 기록했습니다.
핵심 포인트
- DeBERTa-v3 기반의 투명하고 신뢰할 수 있는 AI 텍스트 탐지 프레임워크 제안
- 토큰 수준의 설명을 통해 탐지 결과에 대한 감사 및 맥락화 가능
- GLC-AIText 데이터셋 기준 97.53%의 높은 테스트 정확도 달성
- 기존 RoBERTa-Sentinel 베이스라인을 능가하는 성능 입증
- 학술적 문구 등 언어적 마커를 통한 모델의 해석 가능성 확보
웹 전반에 걸친 대규모 언어 모델 (LLMs)의 급격한 확산은 오정보, 학술적 진실성, 자동화된 콘텐츠 조작, 그리고 취약한 온라인 커뮤니티에 대한 위험에 대한 우려를 불러일으킵니다. GPT-Sentinel과 같은 기존의 트랜스포머 (Transformer) 기반 탐지기들은 가능성을 보여주었으나, 다양한 모델의 출력물과 패러프레이징 (Paraphrasing) 공격에 대해 일반화하는 데 어려움을 겪고 있으며, 이는 신뢰할 수 있는 웹 생태계를 구축하는 데 있어 그 역할을 제한합니다. 본 연구는 합성 콘텐츠의 미세한 구조적 불규칙성을 포착하기 위해 DeBERTa-v3의 분리된 어텐션 (Disentangled Attention)을 활용하는 책임감 있는 AI 생성 텍스트 탐지 프레임워크인 DeBERTa-Sentinel을 소개합니다. 핵심 설계 원칙은 투명성입니다. 블랙박스 형태의 상용 탐지기와 달리, DeBERTa-Sentinel은 결정에 대한 토큰 수준 (Token-level)의 설명을 공개하여, 영향을 받는 이해관계자인 저널리스트, 교육자, 그리고 플랫폼의 신뢰 및 안전 (Trust and Safety) 팀이 탐지 결과를 감사하고, 이의를 제기하며, 맥락화할 수 있도록 합니다. 28,057개의 인간 및 LLM 생성 샘플 (GPT, LLaMA, Claude)로 구성된 GLC-AIText 데이터셋을 60-20-20 비율로 사용하여, DeBERTa-Sentinel은 98.21%의 검증 정확도 (Validation Accuracy)를 달성하였으며, NeurIPS 2025의 RoBERTa-Sentinel 베이스라인을 능가하여 97.53%의 테스트 정확도 (Test Accuracy), 95.89%의 정밀도 (Precision), 99.33%의 재현율 (Recall), 99.53%의 ROC-AUC를 달성하고 0.665%의 미탐율 (False Negative Rate)을 유지했습니다. 모델의 해석 가능성 (Interpretability)은 합성 텍스트와 관련된 학술적 문구 및 공식적인 전환어와 같은 언어적 마커를 드러내며, 이는 검증 가능하고 감사 가능한 콘텐츠 진위 결정에 대한 이해관계자들의 요구를 직접적으로 지원합니다. 편향을 줄이고 설명 가능성 (Explainability)을 향상시키는 책임감 있는 탐지 방법을 발전시킴으로써, DeBERTa-Sentinel은 신뢰할 수 있고 윤리적이며 인간 중심적인 AI 시스템을 촉진합니다. 코드와 데이터는 https://github.com/Galileo-Galili/HUMAN-VS-AI-TEXT-DETECTION 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기