NeurIPS의 사전 LLM 대비 2025년 논문 검사를 두 번째 AI 텍스트 감지기로 재실시한 결과
요약
본 기사는 NeurIPS 논문 심사 과정에서 AI 텍스트 감지기(ParaTrace v7)를 사용하여 과거 및 최신 논문을 비교 분석한 결과를 담고 있습니다. 테스트 결과, 2022년 제출된 논문은 두 감지기 모두 플래그 지정하지 않았으나, 2025년 논문의 경우 ParaTrace v7이 더 높은 비율로 AI 사용을 의심하는 경향을 보였습니다.
핵심 포인트
- AI 텍스트 감지기는 연도별/제출 시점별 차이를 보임.
- ParaTrace는 인간의 글이라도 AI가 다듬은 경우 플래그 지정할 수 있음.
- 감지기 간 결과 불일치 및 위양성(false positive) 가능성이 제기됨.
- AI 교정 편집을 허용하는 학회 정책과 감지기의 오탐지가 충돌할 수 있음.
공개 고지: 저는 상용 AI 텍스트 감지기인 ParaTrace를 개발했으며 무료 티어를 제공합니다. 이 결과를 게시하는 이유는 Pangram과 의견이 다른 부분이 있어 제가 스스로 해결할 수 없어 이 서브레딧에 가져와 논의하고 싶기 때문입니다.
배경 정보. NeurIPS 2026년 포지션 페이퍼 트랙을 심사하기에 앞서, 의장단은 AI 윤리 컨퍼런스 논문들을 Pangram 3.3.2로 검사했는데, 이 중 일부는 2022년에 제출되었고(ChatGPT 이전), 일부는 2025년(NeurIPS 블로그, 2026년 6월 2일)에 제출된 것이었습니다. 저희는 2026년 10월에 자체 서비스인 ParaTrace v7을 이용해 동일한 검사를 수행했습니다.
| AI 점수별 논문 공유 비율 (AI 점수 = 논문의 구절(각 몇백 단어) 중 AI로 평가된 비율) |
| :---: | :---: |
| 연도 | Detector | 논문 수 | ≥ 50 % | ≥ 90 % | 100 % |
| 2022 | Pangram 3.3.2 | 159 | 0.0 % | 0.0 % | 0.0 % |
| 2022 | ParaTrace v7 | 106 | 0.0 % | 0.0 % | 0.0 % |
| 2025 | Pangram 3.3.2 | 204 | 1.0 % | 1.0 % | 0.0 % |
| 2025 | ParaTrace v7 | 123 | 7.3 % | 1.6 % | 0.8 % |
Pangram의 행은 NeurIPS 게시물에서 가져왔습니다. 저희는 논문 중 106개와 123개만 확보할 수 있었으므로, 개수보다는 공유 비율을 비교해 주십시오.
2022년: 두 감지기 모두 어떤 수준에서도 논문을 플래그 지정하지 않았습니다. 구절당 기준으로, 저희가 가진 4,512개 중 18개(0.4%)가 AI로 점수화되었습니다. n = 106일 때, 논문 수준의 위양성률에 대한 95% 상한은 여전히 약 3.5%입니다.
2025년: ≥ 90%에서는 두 감지기 모두 2개의 논문을 플래그 지정했습니다. ≥ 50%에서는 저희가 123개 중 9개를 플래그 지정했고, Pangram은 204개 중 약 2개를 플래그 지정했습니다. 어떤 2025년 논문이 AI를 사용했는지에 대한 진실(ground truth)이 없습니다.
저는 네 가지 설명을 보았습니다: Pangram 3.3.2가 플래그 지정하지 않는 AI 지원 작문. ParaTrace는 설계상 AI가 다듬은 인간의 글을 AI로 간주합니다(저희 테스트에서 AI에 의해 패러프레이징된 인간 텍스트의 42.8%가 플래그 지정됩니다). NeurIPS는 AI 교정 편집을 허용하므로, 저희의 추가적인 플래그 중 일부는 정확히 그것일 수 있으며, 이를 근거로 NeurIPS 정책에 따라 조치하는 것은 잘못일 것입니다. 2025년 인간이 작성한 글에서 발생했지만 2022년 통제가 잡아낼 수 없는 위양성(false positives). ParaTrace는 크기 512의 청크(chunk)에 대한 점수를 매기고, Pangram 4는 기술 보고서(https://arxiv.org/pdf/2607.27183)에서와 동일한 접근 방식을 사용하지만, 이 연구는 Pangram 3.x를 사용했으므로 다른 크기가 사용되었는지 확실하지 않습니다.
깨끗한 2022년 결과가 (3)을 불가능하게 만들지는 않지만, 가능성을 낮출 뿐이라고 생각합니다. 저는 (2)가 격차의 일부를 차지한다고 의심하며, 혹시 아는 분이 있다면 AI 사용 공개 정보가 포함된 2025년 논문으로 테스트해보고 싶습니다. Pangram의 공개 테스트 세트에서 직접 비교해보겠습니다. 저희는 Pangram의 2026년 7월 기술 보고서(Pangram 4)에 있는 공개 테스트 중 v7로 점수를 매겼으며, 정확히 일치하는 21개의 결과를 유지했습니다. 이 중 15개 항목에서 Pangram 4와 5점 이내의 차이를 보였습니다. 비교를 위해 일부 항목을 선정하여 보여드립니다: 테스트 Pangram 4 ParaTrace v7 학생 에세이, 완전 AI 작성 (1% FPR에서 포착) 100 % 100 % 학생 에세이, AI 의역 (1% FPR에서 포착) 100 % 100 % 학생 에세이, AI로 다듬음 (1% FPR에서 포착) 100 % 94.2 % 8개 장르 대 최근 채팅 모델 (AUROC) 1.0000 1.0000 뉴스, 리뷰, 소설 등, 전체 길이 (1% FPR에서 포착) 100 % 98.74 % 동일하게, 50단어 미만 (1% FPR에서 포착) 99.70 % 73.02 % 동일하게, 휴먼라이저 적용 후, 전체 길이 (1% FPR에서 포착) 98.93 % 21.42 % 동일하게, 휴먼라이저 적용 후, 50단어 미만 (1% FPR에서 포착) 73.32 % 19.36 % 인간 텍스트가 잘못 플래그 지정된 경우, 기본 설정 0.00 % 1.86 % 유명 작가: AI 텍스트 누락 2.86 % 4.38 % 유명 작가: 인간 텍스트 잘못 플래그 지정 0.00 % 1.41 % "1% FPR에서 포착"은 각 탐지기가 해당 테스트의 인간 텍스트 중 1%를 플래그 지정하도록 조정되었음을 의미합니다. Pangram의 수치는 발표된 대로이며, Pangram Labs는 이를 검토하지 않았습니다. 요약하자면: 깨끗한 AI 텍스트 수준에서는 좋지만, 짧은 텍스트와 휴먼라이저 적용된 텍스트에서는 뒤처지며, 기본 설정에서는 더 높은 오탐률(false-positive rate)을 보입니다. 저희 자체 벤치마크 (보류 데이터만 사용, 인간 검증 텍스트의 약 1%를 플래그 지정하도록 조정된 고정 설정): 우리는 실제 사용자 프롬프트에 대한 AI 생성 답변 26,082개(90개 모델, 26개 개발자, 최대 2025년 10월)을 언어 모델 기반 AI 탐지기로 평가했습니다. 저희는 99.6%의 탐지율을 달성했으며, 훈련에 사용되지 않은 2025년 후반 버전 모델에서 나온 1,172개 답변에서는 98.6%, 훈련에 모델이 없는 개발자로부터 온 3,948개 답변에서는 99.8%를 기록했습니다.
총 43개 출처의 22,691개 인간 작성 텍스트를 대상으로 0.84%의 오탐지율(false positive rate)을 달성했으며, 이는 텍스트 길이에 따라 감소합니다 (50단어 미만 텍스트(<50 words): 2.8% (24/846), 100~199단어: 1.1%, 400단어 이상(400+ words): 0.17% (7/4,088)). 마지막으로, 공용 견고성 벤치마크에서 나온 11가지 공격(각 1,500개 텍스트)에 걸쳐 텍스트의 96.0%가 여전히 감지됨을 보여줍니다. 가장 어려운 공격은 AI 생성 텍스트를 패러프레이징하는 것이었으며, 이때도 91.5%의 탐지율을 보였습니다.
어디서 실패했는가:
- 훈련 데이터와 다른 인간 작성 글: 훈련 데이터에서 제외된 장르인 성인의 설득력 있는 에세이(Persuasive essays by adults)가 18.4%의 경우 오탐지되었습니다 (32/174). 이것이 제가 가장 우려하는 부분입니다: 훈련 데이터와 다른 인간 작성 글은 위 평균보다 훨씬 더 자주 플래그 지정될 수 있습니다.
- 동의어 교체 도구(synonym-swapping tool)를 거친 인간 텍스트: 16.4%가 플래그 지정되었습니다.
- 휴머나이저 도구 (위 표).
- 영어만.
아직 평가되지 않은 것: 인간과 AI 작성 글이 혼합된 문서, 그리고 2025년 10월 이후에 출시된 모델들. 전체 표, 신뢰 구간 및 방법: 벤치마크 보고서 · 모든 21개 결과 대 Pangram · 과학 논문. paratrace.net에서 계정 없이도 몇 가지 확인을 포함하여 무료로 시도할 수 있습니다. 판결은 통계적 추정치입니다. 저는 우리를 포함한 어떤 탐지기도 논문을 거부하거나 학생에게 낙제하는 유일한 근거가 되어서는 안 된다고 생각합니다. 방법에 대한 질문에 기꺼이 답하겠습니다.
”/u/AltruisticCouple3491 제출 / [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/MachineLearning (hot)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기