
arXiv 전반의 AI 작성 글 측정 방식과 측정의 한계점
요약
arXiv 논문 12,750개를 분석하여 AI 작성 논문의 급증 추세를 연구했습니다. 위양성률을 0.4%로 엄격히 보정하여, ChatGPT 출시 이후 AI 작성 논문의 비중이 약 39%까지 정점에 도달했음을 밝혀냈습니다.
핵심 포인트
- arXiv 논문의 약 3분의 1 이상이 AI 작성으로 의심됨
- 위양성률(False-positive)을 0.4%로 설정하여 측정 신뢰도 확보
- 초록보다 본문 전체 텍스트에서 AI 작성 신호가 더 강력하게 나타남
- ChatGPT 출시 이후 AI 작성 논문 비율이 급격히 상승하는 추세 확인
arXiv 전반의 AI 작성 글을 측정한 방법과 측정 방식이 한계에 부딪히는 지점
우리는 12,750개의 arXiv 논문 전체 텍스트를 점수화했으며, 그 결과 새로운 논문의 약 3분의 1이 기계가 작성한 것처럼 읽힌다는 것을 발견했습니다. 여기에는 방법론, 결과, 그리고 한계점에 대한 솔직한 설명이 담겨 있습니다.


위양성(False-positive)의 하한선
"X의 N%가 이제 AI이다"라고 말하는 헤드라인 유형이 있는데, 대부분은 읽을 가치가 없습니다. 왜냐하면 그 수치 뒤에 있는 탐지기(detector)가 실제 인간이 작성한 글의 일부도 AI로 분류하기 때문입니다. 만약 어떤 도구가 새로운 논문의 40%를 기계가 작성한 것으로 표시하지만, ChatGPT가 존재하기 전에 작성된 논문의 20%도 기계가 작성한 것으로 표시한다면, 진짜 이야기는 아무도 언급하지 않은 그 20%에 있습니다.
그래서 우리는 그러한 반론을 중심으로 연구를 구축했습니다. 여기서 설명하는 우리의 탐지기는 학술적 글쓰기(academic writing)에 맞춰 보정되었습니다. 0.4%의 위양성률(false-positive rate)에서 이 탐지기는 LLM(대규모 언어 모델) 이전의 실제 과학 텍스트의 99.6%를 통과시키며, AI 학술 텍스트의 85%를 찾아냅니다. 우리는 그 위양성률을 기준점으로 삼았습니다. ChatGPT 이전인 2021년과 2022년에 제출된 논문들을 가져와 이를 실제 인간이 작성한 정답(ground-truth)으로 취급하고, 정확히 그중 0.4%가 탐지되도록 플래그 임계값(flag threshold)을 설정했습니다. 그 선이 하한선입니다. 우리가 보고하는 모든 수치는, 설계상 LLM 이전의 실제 글쓰기가 0.4%에 머물도록 설정된 임계값 이상의 논문 비율입니다. 따라서 ChatGPT 이전의 연도들은 내장된 대조군(control) 역할을 합니다. 만약 이러한 증가가 탐지기의 오류(artifact)라면, 2021년과 2022년의 수치도 2026년만큼 높게 나타나야 합니다. 첫 번째 그림은 그렇지 않음을 보여줍니다.
우리가 측정한 것
우리는 2023년 1월부터 2026년 7월까지 매달 분야당 약 25편의 논문을 10개 분야 그룹에서 샘플링했으며, 여기에 2021년과 2022년에 걸친 8개월의 대조군 기간을 더해 총 12,750편의 논문을 조사했습니다. 각 논문에 대해 버전 1 PDF를 추출했으므로, 2026년에 수정된 논문이 2023년 슬롯으로 현대적인 텍스트를 유출할 수 없도록 했습니다. 우리는 초록(abstract) 대신 본문 전체 텍스트를 점수화했는데, 초록은 신호(signal)를 과소평가하기 때문입니다. 우리는 동일한 논문이 초록에서는 20% 미만의 점수를 받지만 본문에서는 70% 이상의 점수를 받는 것을 확인했습니다. 보고된 모든 수치는 부트스트랩(bootstrap) 95% 신뢰 구간을 포함합니다.
결과
표시된 점유율은 2021년과 2022년 내내 0.4%로 정체되어 있다가, ChatGPT 출시 후 몇 달 이내에 급증하며, 두 차례의 파동을 거쳐 가장 최근의 완전한 분기 동안 약 32%까지 상승하고, 2026년 초에는 39% 근처에서 정점을 찍습니다. 분야별 격차는 매우 크며, 표와 두 번째 그림이 이를 뒷받침합니다. 아래 값은 2026년 7월까지의 12개월 동안 각 분야의 표시된 점유율(flagged share)과 그에 따른 LLM 이전(pre-LLM) 대조 수준(control level)입니다.
| 분야 그룹 | LLM 이전 대조 | 최근 표시된 점유율 | 95% CI |
|---|---|---|---|
| 컴퓨터 과학 (Computer science) | 0.2% | 65.0% | [59.3, 70.3] |
| ... |
컴퓨터 과학이 약 65%로 가장 높습니다. 수학은 0.7% 근처로 가장 낮으며, 한계점(limitations) 섹션에서 왜 이 낮은 수치를 해석하기 어려운지 설명합니다. 대조(control) 열은 세 가지 민감도 설정(sensitivity settings)에 걸쳐 평균을 낸 각 분야의 2021년~2022년 표시율입니다. 가장 많이 상승한 분야는 LLM 이전 대조 수준이 가장 높았던 분야가 아니므로, 높은 시작점이 상승을 설명하지는 않습니다.
한계점 (Limitations)
대조 샘플 크기 (Control sample size). 각 분야의 ChatGPT 이전 대조군은 200편의 논문입니다. 0.4%의 표시율(flag rate)에서는 2,000편의 전체 대조군 중 단 8편의 논문만이 표시되며, 이는 10개 분야에 매우 희박하게 분산되어 있으므로 분야당 단일 임계값(single-threshold)을 사용하는 대조율은 정밀도가 떨어집니다. 통합된 하한선(pooled floor)은 잘 추정되어 있으며 본 연구의 기준점이 되지만, 분야별 대조 수준은 근사치일 뿐입니다. 더 큰 대조군을 사용하더라도 이 문제는 해결되지 않습니다. 분야당 1% 미만의 비율을 확정하려면 분야당 수천 편의 대조 논문이 필요하지만, 2023년 이전의 arXiv 볼륨에는 그만한 양이 포함되어 있지 않기 때문입니다.
낮은 점수는 낮은 채택률(adoption) 또는 탐지기의 사각지대(blind spot)를 나타낼 수 있습니다. 수학이 가장 명확한 사례입니다. 수학 논문은 표기법(notation)과 정리-증명(theorem-proof) 구조가 지배적이며, 방정식과 참고 문헌을 제거하고 남은 산문(prose)은 드문드문하며 탐지기가 학습한 과학적 영어(scientific English)와는 다릅니다. 모델의 도움을 많이 받아 작성된 수학 논문은 그 산문이 탐지기의 분포를 벗어나기(out of distribution) 때문에 낮은 점수를 받을 수 있으며, 따라서 수학 분야에서의 낮은 점수는 사람이 논문을 작성했다는 약한 증거가 됩니다. 이 결과는 두 가지 매우 다른 설명, 즉 낮은 채택률 또는 해당 레지스터(register)에서의 탐지기 민감도 감소와 일치하며, 이 데이터로는 두 가지를 구분할 수 없습니다. 분포 내(in-distribution) 가정이 가장 강력한 분야, 즉 산문 비중이 높은 분야들이 가장 많이 상승하므로, 이러한 혼란 변수(confound)가 전체적인 추세를 설명하지는 않습니다. 하지만 낮은 점수를 기록하는 분야에서 순위는 채택률의 하한선(lower bound)으로 해석되어야 합니다.
탐지기 커버리지(Detector coverage). 탐지기는 다른 생성기(generators)보다 특정 생성기에 더 민감하며, 저자들이 실제로 사용하는 모델과 프롬프트의 정확하고 비공개적인 혼합(mixture)에 대해 탐지기를 평가할 수는 없습니다. 불완전한 커버리지는 플래그(flag) 비율을 낮추므로, 보고된 유병률(prevalence)은 하한선입니다. 즉, 실제 점유율은 우리가 측정한 값보다 최소한 그만큼은 됩니다. 탐지기 기술 보고서(write-up)는 생성기별 성능을 보고합니다.
플래그가 곧 저자성을 의미하지는 않습니다. 탐지기는 텍스트가 기계가 작성한 것처럼 읽히는지 여부를 알려진 오류율을 가진 보정된 확률(calibrated probability)로 추정합니다. 탐지기는 가볍게 편집된 문서와 완전히 생성된 문서를 구분할 수 없으며, 단일 점수는 결코 특정 개인을 비난할 근거가 될 수 없습니다. 우리는 과도한 AI 보조 편집을 포함하여, 기계와 유사한 글쓰기(machine-like writing)의 유병률을 보고합니다.
시도해보기
탐지기 실행 비용은 저렴하며 우리는 이를 통해 수익을 창출하지 않습니다. 여기에서 모든 arXiv 논문에 대해 무료로 시도해 볼 수 있으며, 여기에서 귀하의 텍스트로도 시도해 볼 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기