GPT 도움 글쓰기를 해석 가능한 스타일로메트리 특징으로 탐지하기
요약
본 논문은 제출된 텍스트 자체에서 추출한 해석 가능한 스타일로메트리 특징을 활용하여 GPT 도움 글쓰기를 탐지하는 방법을 제시합니다. 90명의 참가자 데이터를 기반으로 여덟 가지 머신러닝 분류기를 평가했으며, Random Forest가 높은 성능(ROC-AUC 0.87)을 보였습니다.
핵심 포인트
- 텍스트 자체의 스타일로메트리 특징으로 GPT 도움 글쓰기 탐지 가능.
- Random Forest 모델이 ROC-AUC 0.87, F1-점수 0.84를 달성하며 높은 성능 입증.
- 어휘적 및 문법적 특징이 예측 결과에 주요하게 기여함 (SHAP 분석).
학계에서 GPT의 도움을 받은 글과 독립적으로 작성된 학생의 글을 구별하는 것은 중요한 과제가 되었습니다. 본 논문은 제출된 텍스트 자체에서 추출한 해석 가능한 스타일로메트리(stylometric) 특징들의 판별 능력을 평가합니다. 독립적으로 작성한 글과 ChatGPT의 도움을 받아 작성한 글 모두를 쓴 90명의 참가자 데이터를 사용하여, 동일 참가자의 데이터를 검증 과정 동안 함께 유지하면서 여덟 가지 머신러닝 분류기(machine learning classifiers)를 평가했습니다. 분리된 테스트 세트에서 Random Forest는 ROC-AUC 0.87과 F1-점수 0.84를 달성했으며, 위양성률(False Positive rate)과 위음성률(False Negative rate)은 각각 22.2%와 11.1%였습니다. SHAP 분석에 따르면 어휘적 및 문법적 특징들이 결과 예측을 주도하는 것으로 나타났습니다. 이러한 발견들은 투명하고, 텍스트 자체 고유의 특징들이 GPT 도움 글쓰기를 탐지할 수 있는 측정 가능한 신호를 제공함을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기