
Pangram은 어떻게 작동하나요?
요약
Pangram은 텍스트의 스타일 패턴을 분석하여 인간과 AI의 글쓰기를 구별하는 신경망 기반 분류 모델입니다. 저자 식별 기술을 활용해 글의 스타일을 지도상의 좌표로 매핑함으로써 ChatGPT나 Claude 같은 모델의 생성물을 정밀하게 탐지합니다.
핵심 포인트
- 저자 식별(Author Identification) 원리를 활용한 AI 탐지 방식
- 글쓰기 스타일을 지도상의 클러스터로 매핑하여 분류
- 단일 신호가 아닌 수십만 개의 신호를 종합하여 오탐지 방지
- 새로운 AI 모델 출시 시에도 일반화된 탐지 성능 유지
Pangram은 어떻게 작동하나요?
우리가 차이점을 구별하는 방식
우리는 AI가 생성한 글을 신뢰할 수 있게 식별하는 능력이 중요하다고 생각하며, 이를 수행하는 탐지기(detector)를 구축했습니다. 이 문제가 매우 중요하기 때문에, 그것이 어떻게 작동하는지에 대해 투명하게 공개하는 것이 현명하다고 판단했습니다.
어떤 저자가 문장을 쓸 때, 그들은 문장이 어떻게 구성되어야 하는지에 대해 수천 가지의 의식적, 무의식적 결정을 내립니다. 근본적으로 AI 탐지는 저자 식별(author identification)의 문제로, 어떤 결정들이 어떤 유형의 저자에게 전형적인지를 분류하는 것입니다. 우리는 이를 수행할 수 있는데, ChatGPT와 같은 LLM(Large Language Models)은 인간은 아니지만, 여전히 결정을 내리는 단일 저자이기 때문입니다. 그들이 내리기 쉬운 결정의 유형 또한 제약되어 있습니다. 어시스턴트 모델(assistant models)은 질문에 효과적으로 답하기 위해 도움이 되고 명확한 글을 생성해야 합니다. 이러한 선호도는 학습(training) 과정에서 모델에 내재되며, 일단 내재되면 이러한 특성이 드러나는 것을 막기가 매우 어렵습니다.
Pangram이란 무엇인가요?
Pangram은 분류 모델(classifier model)이라고 불리는 신경망(neural network)의 일종입니다. 가장 넓은 의미에서, Pangram은 글의 일부를 읽고 — 방대한 학습된 패턴 세트를 사용하여 — 그것이 AI에 의해 생성되었는지 여부를 추정합니다.
Pangram은 유사한 글쓰기 스타일을 가진 저자들은 서로 가깝게 배치하고, 스타일이 다른 저자들은 더 멀리 배치하는 일종의 지도를 구축함으로써 인간과 LLM의 글쓰기를 구별하는 법을 배웁니다. 이 지도 위에서 인간이 작성한 텍스트와 AI가 생성한 텍스트는 뚜렷한 클러스터(clusters)를 형성하며, 우리의 연구에 따르면 Pangram은 ChatGPT 및 Claude와 같은 주요 상용 언어 모델들을 서로 다른 영역에 위치시킬 수 있음을 보여줍니다.
Pangram이 이전에 본 적 없는 글을 마주했을 때, Pangram은 이미 알고 있는 텍스트와 비교함으로써 해당 글이 지도상의 어디에 위치해야 하는지를 결정합니다. 글의 단일한 측면이 위치를 결정하는 것이 아니기 때문에, 인간 작가가 즐겨 사용하는 em dash(엠 대시)와 같은 장치 하나를 ChatGPT가 채택했다고 해서 작가가 잘못 분류될 위험은 없습니다. 눈에 띄는 LLM 특유의 표현(LLM-isms)은 Pangram이 고려하는 수십만 개의 신호 중 하나일 뿐입니다.
결과적으로 산출된 좌표가 인간이 작성한 영역에 떨어지면, Pangram은 해당 텍스트를 인간이 작성한 것으로 예측합니다. 만약 좌표가 더 모호한 영역에 떨어지거나, 동일한 텍스트의 서로 다른 구절이 서로 다른 방향을 가리킨다면, Pangram은 해당 글에 AI 작성 내용이 포함되어 있을 수 있다고 의심하기 시작합니다. 이것이 Pangram에 최소 단어 수 제한이 있는 이유입니다. 단어 수가 많을수록 더 정밀한 좌표를 얻을 수 있기 때문입니다. 동일한 접근 방식은 Pangram이 새로운 AI 모델 출시에도 일반화(generalize)할 수 있도록 돕는데, 새로운 모델들은 대개 이전 모델의 스타일과 어조를 많이 물려받는 경향이 있어 지도의 매우 유사한 영역을 차지하기 때문입니다.
Pangram은 다른 AI 탐지기보다 뛰어납니다
AI 작성을 탐지하려는 이전의 시도들은 처참하고 공개적인 실패를 겪었습니다. 이는 그들이 거대 언어 모델(Large Language Models, LLMs)이 텍스트를 생성하는 방식을 역공학(reverse-engineer)하려고 시도했기 때문입니다. 이러한 탐지기들은 문장의 모든 단어 뒤에서 다음과 같이 질문했습니다: 만약 내가 LLM이라면, 다음에 어떤 단어가 올 것이라고 예상할까?
예를 들어, “I’m going to take my dog for a …”와 같은 문장 파편이 주어졌을 때, AI 모델은 “walk”나 “run”을 다음에 올 가능성이 매우 높은 단어로 고려할 것이며, 반면 “harbinger”나 “verglas”와 같은 문맥에 맞지 않는 단어들은 가능성이 낮은 후보가 될 것입니다. 초기 탐지기들은 LLM이 예측하는 단어 순위(ranking)를 재구성하여 실제로 나타나는 단어와 비교하려고 시도했습니다. 따라서 텍스트가 예측 가능한 선택을 더 자주 따를수록, 탐지기는 이를 AI가 생성한 것으로 분류할 가능성이 높았습니다. 본질적으로 이는 LLM이 문장에서 다음에 오는 단어를 만났을 때 얼마나 당혹스러워할지(perplexed)를 반영하는 것이며, 따라서 이러한 방식의 AI 탐지를 퍼플렉시티 분석 (perplexity analysis)이라고 불렀습니다.
퍼플렉시티 분석 (Perplexity analysis)에는 많은 문제점이 있습니다. 인간의 문장 또한 LLM의 산문만큼이나 빈번하게 정형화(canalized)되어 있기 때문에, 이 방식은 구분하고자 하는 대상을 측정하는 좋은 척도가 되지 못합니다. 따라서 예측 가능하거나 구조화된 인간의 글은 퍼플렉시티 탐지기에 의해 잘못된 플래그(false flag)가 지정되는 경우가 많은 반면, 동시에 단어를 덜 흔한 유의어로 교체하는 것과 같은 명백한 전략에 의해 이러한 탐지기들은 너무나 쉽게 우회됩니다.
유명한 사례로, 퍼플렉시티 모델은 컴퓨터가 등장하기 이전의 많은 텍스트에 대해서도 실패합니다. 퍼플렉시티 기반의 탐지 방식은 성경, 독립 선언서, 또는 메리 셸리의 *프랑켄슈타인 (Frankenstein)*이 100% AI에 의해 생성되었다고 말하곤 합니다. 이는 LLM이 학습 과정에서 독립 선언서를 수천 번 읽었기 때문에, LLM의 관점에서는 그 안에 포함된 모든 다음 단어가 전혀 놀랍지 않기 때문입니다. 탐지기는 이러한 가능성(likelihood)을 해당 글이 AI에 의해 생성되었다는 증거로 오해하는 것입니다.
Pangram은 LLM이 텍스트를 생성하는 방식을 역공학(reverse-engineer)하려 하지 않기 때문에 이러한 문제를 피할 수 있습니다. Pangram은 각 단어를 하나씩 살펴보며 "LLM이라면 여기에 무엇을 쓸까?"라고 묻는 대신, 전체 텍스트를 보고 "이것은 누구처럼 들리는가?"라고 묻습니다. 이러한 방식을 통해 ChatGPT의 친숙도 수준이 Pangram으로 하여금 역사적 문서를 AI 생성물로 오분류하게 만드는 일은 결코 발생하지 않습니다. 하지만 모든 사례가 이토록 쉬운 것은 아닙니다.
Pangram을 학습시킨 방법
98%의 정확도를 가진 분류기 (classifier)를 학습시키는 것은 어렵지 않습니다. 대부분의 AI 글쓰기는 식별하기 쉬우며, 신경망 (neural network)은 가장 명백한 특징들을 빠르게 학습할 수 있습니다. 거의 누구나 E. E. Cummings의 시와 카라마조프 가의 형제들의 인용구를 비교하여 서로 다른 저자가 썼다고 결론 내릴 수 있는 것처럼, 기본적인 분류기는 AI가 생성한 파스타 레시피와 인간의 일기 내용을 아주 쉽게 구별할 수 있습니다. 하지만 AI 탐지 (AI detection) 분야에서 98%의 정확도는 지독하게 낮은 수치입니다. 2%의 오류율은 문서 50개 중 1개를 오분류한다는 의미이며, 이는 모든 예측의 신뢰성을 의심케 합니다. 그렇다면, 만약 당신이 상위 2%의 도스토옙스키 구별자라면, 상위 0.01%가 되기 위해 어떤 전략을 사용하시겠습니까?
그 정도 수준에 도달하면, 도스토옙스키를 직접 다시 읽는 것은 수확 체감 (diminishing returns)의 법칙을 따르게 됩니다. 격차를 줄이기 위해서는 도스토옙스키 외에는 아무도 만들어낼 수 없는 특징들을 찾아내야 합니다. 좋은 전략은 몇 명의 전문 성대모사 전문가를 고용하여 가능한 한 가장 설득력 있는 도스토옙스키의 복제본을 쓰게 한 뒤 그 차이점을 연구하는 것일 수 있습니다. 이것이 바로 우리가 Pangram을 학습시키는 방식입니다. 상업적 라이선스를 보유한 인간 작성 텍스트 데이터셋의 모든 요소에 대해, 우리는 원본과 최대한 유사한 AI 복제본 (AI double)을 생성합니다. 이 복제본들은 길이, 어조, 주제가 원본과 동일하지만, AI가 생성한 것입니다. 그런 다음 우리는 이러한 인간-AI 텍스트 쌍 (text pairs)을 통해 Pangram 모델을 학습시킵니다.
이러한 쌍들을 구별하는 법을 배우면서, Pangram은 내부 지도 상의 경계 영역 (boundary areas)에 대한 해상도를 효과적으로 높입니다. Pangram의 지도가 가능한 한 정확하도록 만들기 위해, 우리는 데이터 오염 (data poisoning)에 극도로 주의를 기울이고 있습니다. 우리가 보유한 기확인된 인간 텍스트 데이터셋은 AI가 인터넷에 풀리기 전인 2021년 이전의 자료들로 구성되어 있습니다. 이는 현재로서는 잘 작동하지만, 언어가 변화함에 따라 우리도 조정해야 한다는 사실을 인지하고 있습니다. 데이터 드리프트 (data drift)가 문제가 되기 전에 선제적으로 대응하는 것은 우리의 최우선 연구 과제 중 하나입니다.
Pangram이 제대로 하고 있다는 것을 어떻게 알 수 있을까요?
Pangram은 텍스트만으로 예측을 수행하는 통계 모델 (statistical model)이므로, 그 정확도 또한 통계적으로 검증되어야 합니다. 그것이 바로 우리가 하는 일입니다. 우리는 출시하는 모든 Pangram 모델뿐만 아니라, AI 연구소(AI lab)가 그들의 LLM을 업데이트할 때마다 내부 벤치마크 (internal benchmarks)를 공개합니다. 또한 우리는 시카고 대학교 (University of Chicago) 및 메릴랜드 대학교 (University of Maryland)의 팀과 같은 독립적인 제3자로부터 테스트와 검증을 받았습니다.
만약 당신이 연구자이거나, 혹은 정말 좋은 아이디어를 가지고 있으며 그 결과를 공개할 것을 약속한다면, 우리의 API 크레딧 지원 (API credit grants) 중 하나를 신청하여 직접 우리의 모델을 테스트해 볼 수 있습니다. 우리는 항상 개선할 방법을 찾고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Lobste.rs AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기