AI가 제가 작성한 12개의 블로그 게시물을 평가했습니다: 25점 만점에 15.1점
요약
작성자가 AI의 도움을 받아 작성한 블로그 게시물 12개를 컨텍스트 서브 에이전트를 이용해 교차 검증한 결과를 공유합니다. 초기 평균 점수는 25점 만점에 15.1점이었으나, 수정 후 재감사를 거쳐 21점을 기록했습니다. 평가 기준은 독창성, 구체성, 진정성을 중심으로 하며, AI 활용 글쓰기에서 반복되는 결함을 포착하는 시스템의 중요성을 강조합니다.
핵심 포인트
- AI 기반 콘텐츠는 '템플릿' 구조적 오류를 가질 수 있다.
- 재감사(re-audit)와 운영 규칙을 통해 품질 관리가 가능하다.
- 평가 기준은 독창성, 구체성, 진정성에 초점을 맞춘다.
- 시스템이 포착하는 결함은 반복적인 패턴에 한정된다.
저는 2026년 8월 16일에 두 개의 새로운 컨텍스트 서브 에이전트(subagents)를 이용해 제가 AI의 도움을 받아 작성한 블로그 게시물 12개를 각각 6개씩 교차 검증했습니다. 평균 점수는 25점 만점에 15.1점이었습니다. 가장 큰 발견은 사실적 오류가 아니었습니다. 그것은 일종의 '템플릿'이었습니다. 네 개의 게시물이 거의 동일한 가짜 에피소드 문장 구조(
| 결함 (Defect) | 예시 (Example) | 기계 감지 가능 여부 (Machine-detectable) |
|---|---|---|
| 출처가 불분명한 정확한 수치 (Unsourced precise number) | 세 가지 다른 주장(claims)에 |
정확히 한 번만 적용되는 규칙(exactly-once rule)은 패치가 잘못된 단락을 조용히 다시 작성하는 것을 절대 허용하지 않습니다. 건너뛴 패치는 실패 목록에 표시되며, 사람이 이를 확인합니다.
점수가 의미하는 것

첫 번째 재감사(re-audit) 점수는 25점 만점에 19점으로, 제가 설정한 20점 기준보다 낮았기 때문에 먼저 지적된 항목들을 수정했습니다. 두 번째 재감사에서는 25점 만점에 21점을 받았습니다. 그 이후의 운영 규칙은 다음과 같습니다: 목표는 20점 이상이며, 점수가 이 이하로 떨어지면 지적된 항목들이 수정될 때까지 게시를 막고, 게시 후 3개월이 지나도 점수가 18점 미만으로 계속 떨어지면 확장을 중단하고 원인을 재진단합니다.
다음 감사를 위한 평가 기준(rubric)은 각 축을 기준으로 삼습니다. 독창성(Uniqueness)은 어디서든 발견된 콘텐츠는 1점, 자신만의 예시가 포함된 일반적인 조언은 3점, 세 개 이상의 파일 경로 또는 측정된 값은 5점을 부여합니다. 구체성(Specificity)은 독자가 명령이나 코드를 복사하여 실행할 수 있을 때만 5점입니다. 진정성(Authenticity)은 오진단과 실패 사례가 그 원인과 함께 기록될 때 5점을 받습니다.
이 숫자들을 상대적인 것으로 간주하세요. 이 점수들은 절대적인 기준에서 나온 것이 아니라, 같은 측정 장치(harness)로 다시 측정한 것입니다.
게이트가 잡아낼 수 없는 것
게이트는 반복되는 형태의 결함만 포착합니다.
AI를 활용한 글쓰기를 어떤 양으로 하든, 새로운 컨텍스트로 감사(audit)를 통과하는 것은 비용이 거의 들지 않으며 독자 스스로 검토할 때 놓칠 수 있는 패턴을 찾아냅니다. 체크리스트, 루브릭(rubric), 그리고 한국어 정규 표현식(regex)은 전체 게시물에 있습니다.
제가 제 사이트에 두고 사용하는 무료 도구들: 34개의 계산기 및 사용 가이드 - 대출, 퇴직금, 실수령액, 저축 vs 예금. 새로운 도구들은 광고 없이 이메일 하나로 배포됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기