AI 토큰의 가치는 얼마인가? 야생 AI 생성 웹 텍스트에 대한 스케일링 법칙
요약
본 연구는 웹 데이터에 AI 생성 텍스트(야생 AI 텍스트)가 증가함에 따라 언어 모델 사전 학습에 미치는 영향을 분석했습니다. 추가된 AI 토큰 비율 변화에 따른 보류 손실을 측정하고, 기존 스케일링 법칙으로는 예측할 수 없는 새로운 이점 및 해로움 항을 가진 스케일링 법칙을 제안합니다.
핵심 포인트
- 야생 AI 텍스트는 인간 독자를 위해 작성되며 레이블 없이 포함됩니다.
- AI 토큰 추가는 데이터 부족 모델에서 초기에는 도움이 되지만, 과도하면 손실이 역전됩니다.
- 인간 텍스트가 목표일 경우 AI 텍스트를 필터링하고 인간 텍스트로 보강하는 것이 권장됩니다.
- 새로운 스케일링 법칙을 제안하여 AI 토큰의 가치 변화(부호 전환)를 예측했습니다.
웹 텍스트는 사전 학습 데이터의 대부분을 차지하며, 그 비중이 증가함에 따라 AI가 생성하는 텍스트가 늘어나고 있습니다. FineWeb 품질 필터링을 적용한 결과, 2026년 6월 웹 데이터 토큰 중 Pangram에 의해 AI 생성으로 분류된 비율은 27.5%였으며, 8월에는 31.1%까지 상승했습니다. 합성 데이터나 모델 붕괴(model-collapse) 설정과 달리, 이 야생 AI 텍스트는 여러 모델에서 나오며, 인간 독자를 위해 작성되었고, 사전 학습 코퍼스에 레이블 없이 포함됩니다. 야생 상태의 AI 텍스트가 언어 모델 사전 학습에 어떤 영향을 미칠까요? 이 질문에 답하기 위해, 우리는 추가된 AI 토큰 비율을 변화시키면서 800개의 언어 모델을 사전 학습시켰고, 인간 생성 텍스트와 AI 생성 텍스트 모두에 대한 보류 손실(held-out losses)에 스케일링 법칙을 적용했습니다. 데이터가 부족한 모델의 경우, 사전 학습 데이터에 AI 토큰을 추가하면 처음에는 인간 텍스트에 대한 손실이 낮아지지만, 더 많이 추가됨에 따라 그 이점이 포화되고 빠르게 해로움으로 역전됩니다. 많은 양의 인간 텍스트로 훈련된 모델의 경우, AI 토큰은 거의 즉시 손실을 증가시키는 반면, 동일한 수의 새로운 인간 토큰은 계속해서 이를 낮게 유지합니다. Hoffman et al. (2022)와 같은 스케일링 법칙으로는 이러한 행동을 예측할 수 없습니다. 우리는 AI 텍스트가 없을 때는 Chinchilla로 감소하면서도 AI 토큰의 가치가 부호(sign)를 바꿀 수 있는 별도의 이점 및 해로움 항(benefit and harm terms)을 가진 새로운 스케일링 법칙을 제안합니다. 더 작은 모델에 적용했을 때, 우리의 스케일링 법칙은 모든 AI 비율에 걸쳐 기존 최고 법칙보다 오류율이 41% 낮은 수준으로 최대 3.6배 큰 모델의 보류 인간 텍스트 손실에 대한 AI 텍스트의 영향을 예측했습니다. 우리는 목표가 인간 텍스트인 경우 AI 텍스트를 필터링하고, 학습 데이터셋을 확장하기 전에 인간 텍스트를 반복하며, 검증 손실을 인간 텍스트와 AI 텍스트로 분리하여 보고할 것을 권장합니다. AI 텍스트는 목표가 AI 텍스트일 때 여전히 가치가 있습니다. 우리는 AI, 토픽, 형식 레이블이 포함된 83B 토큰 코퍼스인 WildAI와 800개 모델 및 코드를 https://github.com/pangramlabs/WildAI에서 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기