arXiv 논문 12,750편에서 AI 문체를 측정한 방법과 한계
요약
arXiv 논문 12,750편을 분석하여 AI 작성 판정 비율의 변화와 탐지 도구의 한계를 다룹니다. ChatGPT 출시 이후 컴퓨터 과학 분야의 AI 판정률이 급증했으나, 이는 실제 AI 사용뿐만 아니라 탐지기의 오탐 및 AI 보조 편집의 영향일 수 있음을 지적합니다.
핵심 포인트
- arXiv 논문 분석 결과, 컴퓨터 과학 분야의 AI 작성 판정률이 최대 65%까지 상승함
- 기존 AI 탐지기는 독립선언문도 AI로 오판하는 등 근본적인 결함과 오탐 가능성이 높음
- AI 탐지 시도가 오히려 더 정교한 가짜 데이터를 만드는 악순환을 초래할 수 있음
- 생산량 중심의 환경에서 LLM 사용이 강제되는 게임 이론적 유인이 발생함
2011년에 쓴 PyHPC 워크숍 논문은 기계 작성 27%, 2012년 박사학위 논문은 기준치 42% 바로 아래인 40%로 판정됐음
더는 논문을 출판하지 않지만, 내가 LLM처럼 쓴 것인지 LLM이 내 글에서 배운 것인지 모르겠음. 2015년 IEEE CLUSTERS 논문은 무려 74% 가 나옴
초기 탐지기들은 미국 독립선언문도 AI 작성 확률 100%로 판정했으니 이런 도구는 제대로 작동하지 않음
더 위험한 점은 원리를 모르는 사람들이 이를 근거로 AI 사용을 단정해 학생들에게 심각한 불이익을 준다는 것이며, 이미 모든 교육 단계에서 벌어지고 있음
“AI 생성 콘텐츠나 딥페이크를 탐지하려는 시도에는 근본적 결함이 있음. 탐지 결과로 더 뛰어난 가짜 데이터 생성기를 훈련할 수 있기 때문임. 결국 디지털 영역에서는 아무것도 진짜라고 단정할 수 없는 디지털 불확실성의 균형 상태에 도달함. 디지털 결과물이 인간과 AI 중 누구에게서 나왔는지는 중요하지 않고, 내게 유용한지만 중요함. 유용한 콘텐츠는 핵심에 맞고 사실에 부합하며, 가능하면 새로운 것을 가르쳐줄 만큼 놀라워야 함.” - https://seanpedersen.github.io/posts/digital-uncertainty/
그 논문들이 실제로 훈련 데이터셋에 들어갔을 가능성도 있지 않을까?
저작물을 학습한 뒤 증류까지 했다면 오탐 잡음이 터무니없이 클 수밖에 없음
2021~2026년 arXiv 논문 12,750편의 전문을 분석해 기계 작성으로 판정되는 비율과 ChatGPT 출시 이후 증가 폭을 조사했음
오탐을 피하도록 탐지기를 의도적으로 조정해 ChatGPT 이전 탐지율은 약 0.4%였음. 2026년 1월에는 전체 논문의 약 39%, 컴퓨터 과학에서는 최고 65%가 AI 작성으로 판정됐고, 수학은 0.7%에서 거의 움직이지 않았지만 증명 중심 문체를 제대로 포착하지 못했을 수도 있음. 이는 통계적 신호의 추정치일 뿐 특정 저자가 AI를 사용했다는 증거가 아니며, 기계 작성에는 강한 AI 보조 편집도 포함될 수 있음
어떤 탐지기를 사용했으며, 상용 AI 탐지기가 모두 반박된 상황에서 정확성을 어떻게 확신할 수 있는지 궁금함
시계열 결과는 상당히 설득력 있어 보이지만, 탐지기 훈련 방식이 이 분석과 독립적인지 궁금함
ChatGPT 이전 문서가 양성 훈련 데이터에 포함되는 식의 누수가 있을 수도 있음
LLM 이전 문서에서 나온 오탐 사례를 공개해주면 무엇이 탐지기를 자극하는지 알 수 있을 듯함
LLM이 등장하기 전에도 극소수 저자가 LLM처럼 썼던 것인지 궁금함
2020년 이전 논문까지 확장하면 탐지 시스템의 기준 정확도를 더 잘 파악할 수 있음
모델을 로컬에서 실행할 수 있는지, 아니면 모든 arXiv 사전 공개 논문의 결과표를 제공할 수 있는지 궁금함
많은 논문을 검사하면서 서버에 과부하를 주고 싶지는 않음
기업의 LLM 사용에는 실제로 게임 이론적 유인이 작동함
개발자들은 Claude Code를 닥치는 대로 사용해 겉보기에는 더 나은 코드와 문서를 대량 생산하고, 경영진은 당장 단점이 보이지 않아 이를 장려함. 구조적 품질은 불확실하지만 잘못된 지표로는 생산량만 보이므로, 인지 능력 퇴화를 감수할 가치가 있는지 판단하려면 수년이 걸릴 것임. 하루 종일 LLM을 쓰지 않는 사람은 생산량에서 밀릴 수밖에 없으며, 출판량이 중시되는 과학계에도 같은 압력이 작동할 가능성이 큼
기초 생의학 연구에서는 LLM이 원시 습식 실험 데이터를 대부분 해석하지 못해 대체로 무시되고 있음
그럼에도 수많은 스타트업과 신임 조교수들이 “AI”로 새 영역을 개척한다고 내세우지만, 실제로 가장 효과적인 접근은 LLM보다 기계학습을 사용함
ChatGPT-5.6 Sol의 도움을 받아 2,800줄짜리 Python 기반 Rhino3D 형상을 Python 기반 OCCT/FreeCAD로 이식하고 있는데, 절반 정도 진행한 시점에 36,000줄까지 늘어났음
중복 최소화와 코드 축소를 목표로 계속 지시했지만 결과는 “형편없어도 내게는 유용함”에 가까움. 이 정도 유용성도 무시할 수 없지만, 넘치는 변기를 보며 가치가 극대화됐다고 착각하는 경영진은 두려움
LLM 코드는 무능한 개발자의 코드보다는 낫고, 의욕 있는 평균 개발자의 코드보다는 못하지만 대체로 충분히 쓸 만함
진짜 어려운 질문은 투입 시간·비용 대비 품질이며, 현재로서는 구독 요금 기준 opus/fable 생성 코드가 충분히 유리하다고 봄
가격 인상 전에는 경영진이 무조건 사용을 밀어붙일까 봐 크게 걱정했지만, 이제는 AI가 너무 비싸져 대기업의 추가 도입을 정당화하지 못하기를 바라고 있음
새 도구 자체는 좋지만 관리 지표를 맞추려고 특정 도구 사용을 강요받는 것은 싫음
인지 능력 퇴화 자체가 목적일 수도 있음
인간이 AI에 의존하게 되면 기업은 자신들에게 유리하게 법을 바꿀 영향력을 얻음. 시민이 도심의 거대 데이터센터를 반대해도 기업은 그 데이터센터가 공급하는 AI 없이는 아무것도 할 수 없다고 압박할 수 있으므로, 인간을 무능하고 의존적으로 만드는 것이 핵심일 수 있음
텍스트만 사용하는 모든 AI 탐지 방식과 마찬가지로 정확성이 우려됨
특히 세 탐지기 점수를 마지막에 결합하는 과정이 편향을 만들지 않는다고 어떻게 확신하는지 모르겠고, 소스가 없어 작동 방식을 검토하거나 연구를 재현하기도 어려움. LLM 이전에 직접 작성한 비공개 연구도 높은 점수를 받았고, 다른 논문에서는 거의 모든 문장이 빨간색 “machine-leaning”으로 표시되면서도 점수에는 영향을 주지 않았음. 동일한 텍스트도 LaTeX 서식 유무에 따라 점수가 크게 달라졌음. 결론은 “생성 텍스트 탐지는 어려우며, 가설을 확인해준다는 이유만으로 결과를 받아들여서는 안 됨”이어야 함. 이 글 역시 방금 직접 썼는데 기계 작성 점수가 높게 나옴
가장 우려되는 용도는 학교에서 부정행위 학생을 적발하는 데 이런 도구를 쓰는 것임
학술 환경에서 같은 문제를 살펴본 결과, 텍스트만으로 AI 작문을 신뢰성 있게 탐지하는 것은 불가능하다고 결론 내렸음
인간과 LLM이 우연히 완전히 같은 문단을 썼다면 동일한 입력 하나를 합성과 인간 작성으로 구분할 방법이 없음. 실제로 LLM 특유의 흔적은 있지만 시간과 모델에 따라 달라져, 합성처럼 보이는 인간 글과 인간처럼 보이는 합성 글을 구별할 수 없음. 더 흥미로운 접근은 에세이 말뭉치에서 어휘, 언어적 특징, 문체 임베딩, 일반 임베딩, 오탈자, 오류, 참고문헌이 LLM 도입 이후 어떻게 변했는지 분석하는 것임. 집단 수준에서 학술 문체가 변한 것은 분명하지만 원인을 추적하기는 어려움
아주 짧은 구절이 아니라면 가능한 표현은 빠르게 조합 폭발을 일으키므로, 유한한 조합 때문에 완벽한 분류가 불가능하다는 설명에는 동의하지 않음
촘스키의 말처럼 사람이 말하거나 이해하는 거의 모든 문장은 우주 역사상 처음 등장하는 단어 조합임. 더 큰 어려움은 LLM이 하나의 고정된 표현만 만들지 않으며, 텍스트의 정보 밀도가 낮아 좁은 신뢰구간으로 통계 검정을 하려면 상당한 분량이 필요하다는 데 있음
읽는 논문의 65%가 AI 작성 특성을 보이면 직접 AI를 쓰지 않더라도 AI 문체의 영향을 받게 됨
특히 아직 문체를 형성 중인 신입 연구자에게 더 강하게 나타날 가능성이 큼
AI 문체의 영향은 특정 단어나 수사적 표현처럼 부분적으로 나타나겠지만, AI 생성문은 대개 출력 전체에서 일관되게 AI처럼 들림
인간이 AI의 구문 패턴을 장시간 유지하려면 현재 누구도 완전히 알기 어려운 패턴을 파악하고 각 절을 그림 위조처럼 세밀하게 조정해야 함. 또한 AI 문체도 변해서, 대표적 징후였던 delve는 2024년 중반 이후 급감해 이제 LLM 출력에서 거의 사라졌음. 이를 따라 배운 인간의 글은 오히려 현재 AI 문체와 덜 비슷해짐
그 20%가 뜻하는 바는 탐지 도구가 생각만큼 신뢰할 수 없거나, AI가 인간의 글을 학습해 기존 인간 문체 일부가 이제 AI 잡문의 특징이 됐다는 것일 수 있음
AI 이전에도 잡문을 만들어내던 사람은 있었음
영어 원어민이 아니라서 대부분의 논문이 AI 탐지기에 걸린다는 결과가 놀랍지 않음
LLM에 논문 전체를 써달라고 해서가 아니라 과학적 문체에 익숙하지 않은데 미국 편집자들이 이를 요구하기 때문임. 기본 문장으로 아이디어를 쓰고 LLM으로 매끄럽게 바꿀 수 있음. 각 문단을 직접 쓴 뒤 더 과학적으로 다듬으면 내용은 온전히 자기 것이어도 LLM 생성으로 판정됨. 반대로 영어를 충분히 잘 다듬으면 LLM이 쓴 논문도 인간 글처럼 보이게 할 수 있음
바로 예상했던 사용 방식이며, 잘못됐다고 볼 이유가 없음
영어 실력에는 문제가 없고 석사 논문도 직접 영어로 썼지만, 과학적 문체로 쓰는 작업은 매우 고됨
다시 논문을 쓴다면 손으로 전부 작성할 생각은 없으며, 내용이 의도와 일치하는지 검증하고 잘못 쓴 부분을 고친다면 문제없음. 영어 원어민이 쓴 논문 중에도 LLM으로 다시 쓰면 훨씬 나아질 글이 많음
이것은 잘못된 행위임
“더 과학적으로” 바꾸는 일은 원래 의미를 충실히 보존하는 단순한 문체 수정이 아님
각 문단의 세부 표현은 무엇을 어떻게 전달하는지에 큰 영향을 주므로 온전히 자기 논문이라고 보기 어려움. 애초에 과학적으로 보이는 문체를 추구할 이유도 의문이며, 가장 잘 쓰인 논문은 허세 없이 대화하듯 읽힘. 외부 압력이 있다는 것은 이해하지만 LLM 문장보다 작성자의 기본 문장이 더 나을 듯함
LLM으로 문법·철자를 교정하는 것과 텍스트를 생성하는 것 사이에는 미묘한 경계가 있음
이런 논문은 장황하고 상투적인 부분이 많으므로 AI가 90%를 쓰고, 실제로 새로운 내용과 중요성에 대한 설명만 인간이 작성했을 수도 있음
어쩌면 실제로 그런 방식이 확산 중일 수 있음
논문의 90%가 상투적 문구라면 학술 논문으로 출판할 가치가 있는 내용인지부터 물어야 함
과학 활동에서 글쓰기는 대부분 낭비되는 시간이며, 기계가 능숙하게 할 수 있다면 연구자가 직접 작성할 이유가 적음
일부는 글쓰기 예술가일 수 있지만 대부분은 그렇지 않음
탐지기가 단순히 2022년 이후 문헌에서 늘어난 단어와 전문용어를 AI 특징으로 학습했을 가능성이 있음
예를 들어 LLM과 이를 쓰는 사람들은 LLM을 자주 다루므로 “large language model”이라는 표현 자체가 AI답다고 판정될 수 있음. 이 표현은 2022년 이전에는 드물고 현재와 AI 생성문에서 많이 등장하지만, 현대의 인간 글과 AI 글을 구분하는 좋은 특징은 아님. 2023년 이후에도 LLM 생성문이 거의 없다고 합리적으로 볼 수 있는 대조군에서 arXiv보다 훨씬 낮은 탐지율을 보여야 함. Nature와 Science도 완전히 자유롭지는 않겠지만 2026년까지 검사한다면 arXiv보다 훨씬 낮은 증가 곡선이 나와야 함
타당한 가능성이지만 직감상 실제 탐지 논문의 작은 일부만 설명할 듯함
탐지기를 갱신할 때 이를 완화할 방법을 살펴보겠지만, 2023년 이후의 깨끗한 데이터셋을 확보하기가 어려움. 다른 AI 탐지기로 만들면 결국 그 탐지기보다 나아질 수 없음
합의 프로토콜 등을 연구하는 여러 연구자에게 논문 작성과 연구 중 무엇을 선호하는지 물었더니 거의 모두 연구 자체를 택했음
글쓰기를 더 좋아했다면 다른 직업을 골랐을 가능성이 큼. LLM이 연구 도표와 코드 등을 논문이나 초안으로 바꿔준다면 양질의 연구 논문이 오히려 늘 수 있음. “연구는 하고 싶지만 논문 작성이 번거롭다”는 마찰이 줄어들기 때문임. 연구 역량과 글쓰기 혐오를 두 축으로 놓으면 두 값이 모두 높은 연구자들의 결과물을 LLM이 끌어낼 수 있음. 나쁜 논문도 늘겠지만 장기적으로는 순효과가 긍정적일 가능성이 있음
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기