
기계적 억양의 확산: 3개 언어의 70/70 셀에서 나타나는 AI 텍스트의 리듬적 단조로움
요약
AI 생성 텍스트가 일본어, 영어, 포르투갈어 등 다양한 언어에서 나타내는 문장 길이의 단조로운 패턴인 '기계적 억양(machine accent)'을 연구한 논문입니다. 연구자는 AI 모델들이 언어와 관계없이 인간보다 문장 길이의 변화 폭이 적은 경향을 보이는지 실험했습니다.
핵심 포인트
- AI 생성 텍스트는 인간보다 문장 길이 변동성이 낮은 '기계적 억양'을 보임
- 일본어, 영어, 포르투갈어 등 다국어 환경에서의 재현성 검증 시도
- 모델 업데이트 및 API 단종(Claude 시리즈)에 따른 연구 재현의 어려움 언급
- 언어별 문장 분할 및 지표 측정 방식의 정교화 필요성 강조
어제 저는 Zenodo에 세 번째 연구 논문을 발표했습니다. 이 논문은 일본어 AI 생성 텍스트가 인간의 텍스트보다 문장 길이의 변화 폭이 훨씬 적으며, 제가 테스트한 7개 모델 모두가 동일한 방향으로 편향되어 있음을 보여주었습니다. 저는 이 현상을 "기계적 억양 (machine accent)"이라고 불렀습니다.
발표 후 한 가지 생각이 계속 저를 괴롭혔습니다. 억양은 화자에게 속하는 것입니다. 당신이 어떤 언어를 시도하든 당신을 따라다니죠. 하지만 제가 측정한 것은 일본어뿐이었습니다. 만약 영어구나 포르투갈어에서 그 단조로움이 사라진다면, 제가 말한 "억양"은 결코 억양이 아니게 됩니다. 그것은 단지 일본어에 관한 사실일 뿐이겠죠.
그런 이름은 그 은유를 뒷받침할 만한 가치가 있어야 합니다.
그래서 오늘 저는 네 번째 논문을 발표했습니다. 지난번과 마찬가지로 지뢰를 포함한 현장 노트(field notes) 형식입니다.
실험 설정
두 가지 가설을 세웠습니다. H1: 만약 이 억양이 실재한다면, AI의 단조로움 현상은 모든 모델에서 영어와 포르투갈어에서도 동일한 방향(d < 0)으로 나타날 것이다. H2: 방향은 유지되지만, 그 크기(magnitude)는 언어마다 다를 수 있다.
인간 코퍼스(human corpora)는 ChatGPT 이전의 것이어야 했습니다. 영어의 경우, 2019년 1월부터 2022년 10월까지 Dev.to에서 역대 가장 인기 있었던 게시물 853개를 가져왔습니다. 만약 당신이 당시에 인기 있는 Dev.to 게시물을 작성했다면, 축하합니다. 당신은 이제 과학적 기준점(scientific baseline)이 되었습니다.
포르투갈어는 운이 좋았습니다. 브라질 개발자 포럼인 TabNews는 2022년 5월에 개설되었습니다. ChatGPT는 같은 해 11월 30일에 출시되었습니다. 따라서 모든 게시물이 인간이 작성한 것으로 보장되는 7개월의 기간이 남았고, 저는 이 전체 기간인 403개의 게시물을 가져왔습니다. 짧지만 확실합니다.
AI 측면은 7개 모델 × 10개 주제 × 5회 시도 × 2개 언어로 구성되며, 일본어 연구와 동일한 제로샷 프롬프트(zero-shot prompt)를 번역하여 사용했습니다. 지표 정의는 변경 없이 그대로 유지되었습니다: 버스티니스 (burstiness), 문장 길이 변동 계수 (sentence-length CV), 문단 구조 변동 계수 (paragraph-structure CV). 단 두 가지만 조정했습니다. 일본어의 모라(mora) 수는 pyphen 음절 근사치로 대체되었고, 문장 분할은 포르투갈어를 지원하지 않는 pysbd 대신 두 언어 모두에 공통으로 적용되는 하나의 정규 표현식(regex)을 사용했습니다. 분할 도구를 혼용했다면 언어의 차이가 도구의 차이와 혼동될 수 있었기 때문입니다.
새 측정 결과: 영어 문서 1,202개와 포르투갈어 문서 751개를 합쳐 총 1,953개가 되었습니다. 일본어 숫자는 발표된 세 번째 논문에서 가져왔습니다.
지뢰밭 1: 내 모델들이 단종됨
생성(generation)이 시작되자마자 Claude 3 Haiku, Sonnet 4, 그리고 Opus 4 모두 404 오류가 발생했습니다. 일본 연구에 사용된 세 가지 Claude 모델이 API에서 단종되었기 때문입니다.
재현 스타일의 디자인에는 이것이 큰 걸림돌입니다. 같은 모델이라도 언어가 다르면 작동하지 않습니다. 저는 현재 티어(Haiku 4.5, Sonnet 5, Opus 4.8)로 대체했고, 직접적인 일본어 비교는 두 연구가 공유하는 네 가지 모델(GPT-3.5 Turbo, GPT-4o, GPT-OSS 20B, Llama 3.2 1B)으로 제한했습니다. 논문에서 이 대체 과정을 명확히 밝히고 있습니다.
당시에는 짜증스러웠지만, 결과적으로 연구에서 가장 흥미로운 발견을 제공하게 되었습니다.
지뢰밭 2: GPT-4o가 전체 문서를 코드 울타리 안에 넣음
측정 초기에 GPT-4o 문서 35개는 '0문장'으로 나왔습니다. 열어보니 그 이유를 알 수 있었습니다. 전체 문서가 ```markdown 울타리 안에 놓여 있었기 때문입니다. 리듬 통계(rhythm stats)에 코드가 방해되지 않도록 존재하는 제 코드 블록 제외 기능이 기사 전체를 하나의 거대한 블록으로 인식하고 있었던 것입니다. 수정된 부분은 마크다운 태그를 포함하는 바깥쪽 울타리만 풀었습니다. 순수한 울타리는 실제 코드일 수 있으므로 그대로 두었습니다.
...
pip install rhythm-lens
rhythm-lens draft.md # 언어 자동 감지 (ja/en/pt)
rhythm-lens --lang en draft.md # 또는 명시적 지정
저는 이 게시물을 출판하기 전에 통과시켰습니다. 첫 번째 검사에서 저를 지적했고, 저는 제 자체적인 린터(linter)를 만족시키기 위해 제 단락 구조를 다시 작성했습니다. 도구가 자신을 만든 사람에게 문제가 되는 느낌은 그 도구에 좋은 신호입니다.
논문 및 데이터
논문은 Zenodo에 게시되어 있으며 (텍스트 CC-BY 4.0, 코드 및 데이터 GitHub에서 MIT), 인간 코퍼스 텍스트는 재배포되지 않습니다. 대신 레포지토리에는 메타데이터와 회상 스크립트가 포함됩니다.
- 논문 (Paper): 10.5281/zenodo.21424903
- 코드 및 데이터 (Code and data): github.com/kenimo49/llm-rhythm-crosslingual
- 세 번째 논문 (일본어 어휘 vs. 리듬 지문 (lexical vs. rhythm fingerprints)): 10.5281/zenodo.21413035
이 결과물은 원본 논문이 발표된 지 24시간 만에 출판된 속편이 되었습니다. 질문이 여전히 생생할 때 작업했기에, 모든 스크레이퍼 (scraper), 지표 (metric), 그리고 실수들이 기억 속에 생생하게 남아 있었습니다. 그리고 ChatGPT 이전의 글쓰기 방식을 온전히 유지해 준 커뮤니티가 없었다면 이 중 어느 것도 작동하지 않았을 것입니다. 그러므로 당신의 2021년 Dev.to 게시물이 베이스라인 (baseline)에 포함되어 있다면, 그 리듬에 감사를 표합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기