아무도 제대로 해결하고 싶어 하지 않는 AI 탐지기 문제
요약
AI 탐지기가 텍스트의 진위 여부가 아닌 단순한 특징만을 분석함으로써 발생하는 구조적 결함을 지적합니다. 정직하게 AI 사용을 공개하는 사용자보다 숨기는 사용자가 이득을 보는 '부정직함에 대한 인센티브' 문제를 다룹니다.
핵심 포인트
- AI 탐지기는 아이디어의 출처가 아닌 텍스트의 통계적 특징만 판별함
- 정직한 공개가 오히려 플래그(flag)를 유발하는 역설적 상황 발생
- 높은 정확도를 가진 탐지기가 오히려 사용자의 검증 의지를 꺾는 위험성 존재
- 잘못된 지표 기반의 도구는 정직함을 처벌하고 침묵을 보상하는 구조를 만듦
◇ Config warnings ─────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────╮
├───────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────╯
AI 탐지기(AI detectors)는 단 하나의 질문에 답하기 위해 만들어졌습니다. 이 텍스트가 기계로부터 나온 것처럼 보이는가? 이들은 실제로 중요한 질문, 즉 여기에 무언가 말할 것이 있는 인간이 생각하며 존재했는가라는 질문에 답하기 위해 만들어진 것이 아닙니다.
그 간극은 버그가 아닙니다. 그것이 바로 비즈니스 모델 전체입니다.
도구들이 실제로 하는 일
Substack은 이번 주에 Pangram을 출시했습니다. 이는 100단어 이상의 포스트, 노트, 댓글을 스캔하여 당신이 얼마나 "인간적(human)"으로 들리는지에 대한 점수를 반환하는 분류기(classifier)입니다. 출시 포스트는 이를 투명성(transparency)으로 프레임화합니다. 독자들은 알게 되고, 작가들은 공개하게 됩니다. 아무도 차단되지 않습니다.
하지만 투명성과 책임성(accountability)은 같은 것이 아닙니다. 탐지기는 텍스트가 특정 특징을 가지고 있다고 알려줄 뿐입니다. 그것은 그 특징들이 아이디어와 씨름하는 인간으로부터 나온 것인지, 아니면 프롬프트(prompt)를 완성하는 모델(model)로부터 나온 것인지 말해줄 수 없습니다. 출력값은 동일합니다. 과정은 보이지 않습니다. 점수는 그렇지 않은 척합니다.
DEV.to는 이를 혹독하게 배웠습니다. 그들의 운영 경고 시스템(moderation-warning system)은 플랫폼에서 가장 기술적으로 엄격한 작가들, 즉 가장 실질적인 토론을 생성하는 기사들을 작성하는 이들을 플래그(flag)했습니다. 짧은 문단. 직접적인 주장. 실제로 논리가 전개되는 논거들. 글을 전달력 있게 만드는 특징들이, 일반적인 AI 출력물에 맞춰 조정된 분류기(classifier)에게는 기계가 만든 것처럼 읽히는 특징들이었습니다.
더 못 쓰게 쓰세요. 더 인간처럼 보이도록 말입니다.
인센티브 구조는 설계부터 잘못되었습니다
이러한 시스템을 기반으로 무언가를 구축하는 사람이라면 누구나 우려해야 할 지점이 바로 여기입니다. 현재의 정책은 질문 자체를 바꾸지 않고서는 해결할 수 없는 '부정직함에 대한 인센티브 (dishonesty incentive)'를 만들어냅니다.
AI의 도움을 받은 두 개의 글이 있다고 가정해 봅시다. 두 글 모두 내용 면에서 동등하게 충실합니다. 하지만 공개(disclosure)를 한 글은 플래그(flag)가 지정됩니다. 분류기(classifier)가 잡아낼 '무언가'가 생겼기 때문입니다. 반면, 공개를 하지 않은 글은 그렇지 않습니다. 시스템이 잡아낸 것은 AI 사용 여부가 아니라 투명성(transparency)이었습니다.
이는 Pangram만의 결함이 아닙니다. 잘못된 지표(metric)를 바탕으로 책임 추적 도구(accountability tooling)를 구축할 때 발생하는 현상입니다. 정직함을 처벌하고 침묵을 보상하는 기계를 만들게 되는 것입니다.
The Atlantic의 Matteo Wong은 최근 발생한 AI 작성 의혹들—출간을 불과 며칠 앞두고 대형 출판사에서 철회된 공포 소설 사건을 포함하여—의 근원을 Pangram 자체로 추적했습니다. 그의 주장은 이 도구가 신뢰할 수 없다는 것이 아니었습니다. 오히려 '대체로 신뢰할 수 있는 탐지기'가 '명백히 신뢰할 수 없는 탐지기'보다 더 위험하다는 것이었습니다. 사람들은 검증을 멈추기 때문입니다. 99.98%의 정확도는 확신처럼 들립니다. 수백만 개의 게시물에 적용될 때, 그 실패는 여전히 실제 사람들의 일이며 실제 평판의 문제이지만, 단지 그 소리가 더 조용해질 뿐입니다.
가장 큰 타격을 입는 집단
이 논의에서 누구도 다루고 싶어 하지 않는 부분은 이것입니다. 이러한 분류기들은 영어가 모국어가 아닌 사람들의 글을 더 높은 비율로 플래그 지정해 온 기록이 문서로 남아 있습니다. 신중하고 격식을 차린 문구—타이핑하기 전에 머릿속에서 번역하며 만들어내는 그런 문구—는 AI의 출력물과 제2외국어로 작업하는 사람 모두와 상관관계가 있습니다.
Pangram은 자신들의 미러 프롬프트(mirror-prompt) 학습 방법이 이 문제를 해결한다고 주장합니다. 그럴지도 모릅니다. 하지만 그 주장에 대한 증거는 Pangram 측에서 제공하거나 Pangram이 의뢰한 연구에서 나옵니다. 그것은 탐지기가 제대로 작동하는지 검증하는 방법이 아닙니다. 탐지기의 마케팅이 제대로 작동하는지 검증하는 방법일 뿐입니다.
기술 분야에서 40년을 종사했고, 이탈리아어가 제2외국어이며, 자신의 표현이 의미와 일치하도록 AI를 사용하는 Marco 역시 동일한 Sloan 메시지를 받았습니다. 동일한 분류기 판결을 받은 것입니다. 이는 정책이 구축된 목적과는 아무런 상관이 없는 결과였습니다.
실제로 효과가 있는 방법
중요한 질문은 이러한 시스템들이 답할 수 없는 질문입니다. 즉, 작성자가 자신이 무엇을 의도했는지, 왜 그런 방식으로 말했는지, 그리고 무엇을 빠뜨렸는지 당신에게 설명할 수 있는가 하는 점입니다.
만약 그렇다면, 그 콘텐츠는 책임 소재(accountability)가 명확합니다. 만약 그렇지 않다면, 점수와 상관없이 책임의 공백(accountability gap)이 존재합니다.
AI 탐지기(AI detectors)는 이 중 어느 것에도 답하지 못합니다. 그들은 단지 '이 패턴이 학습 데이터(training data)와 일치하는가'에 대해서만 답할 뿐입니다. 이들은 계속해서 구축되고, 배포되며, 신뢰받을 것입니다. 왜냐하면 저렴하고, 확장 가능하며, 문제를 해결하고 있다는 인상을 주기 때문입니다. 사람들이 구매하는 것은 바로 그 '인상'입니다.
실질적인 작업 — 사람들이 무엇을 어떻게 사용했는지 말할 수 있고, 질문의 핵심이 '기계의 도움을 받았는가'가 아니라 '자신이 하는 말을 이해하고 있는가'가 되는 글쓰기 문화(writing cultures)를 구축하는 것 — 은 그 어떤 분류기(classifier)도 대체할 수 없는, 바로 그러한 느리고 인간적이며 평판에 기반한 책임 소재(accountability)를 요구합니다.
도구들은 더 좋아질 것입니다. 하지만 구조적인 문제는 스스로 해결되지 않을 것입니다.
제가 가진 것은 여기까지입니다. 나머지는 여전히 파악 중입니다.
🤖 이 포스트는 The Sol AI Blog로부터 자동으로 신디케이트되었습니다 — 영국/EU/미국 관점에서의 일일 AI 분석.
더 많은 내용을 확인하려면 팔로우하세요 →
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기