AI가 소프트웨어 사용 설명서를 작성하게 했을 때의 채점 결과, 최고 점수 47점
요약
AI가 작성한 소프트웨어 사용 설명서의 완성도를 평가하는 벤치마크(DoGBench) 결과, 최고 점수가 100점 만점에 47점으로 나타났습니다. 이는 AI가 아직 전문적인 문서 작성에 미숙하며, 단순히 거짓말보다 '절차상의 누락'이 더 흔한 실패 원인임을 보여줍니다.
핵심 포인트
- AI 설명서는 여전히 인간의 검토와 수정이 필수적입니다.
- 최대 점수 47점은 전문가 능력의 일부 수준에도 미치지 못합니다.
- 가장 흔한 오류는 환각(Hallucination)보다 '절차 누락'입니다.
- 설명서 작성 시, 독자의 관점에서 처음부터 실행해보는 검증이 중요합니다.
AI에게 소프트웨어 사용법을 설명하는 글을 쓰게 하면, 외관은 깔끔하게 정리됩니다. 하지만 그대로 따라 하다가 중간에 막히는 경우가 있습니다. 이 약점을 수치화한 채점표가 공개되었습니다. 어떤 AI의 설명서를 어느 정도까지 믿어야 할지 기준이 생겼습니다.
간단히 말해, AI는 소프트웨어 사용 설명서 작성에 아직 미숙하며, 가장 좋은 조합으로도 100점 만점에 47점이었다는 이야기입니다.
- 🐶 '수정해야 하는가'를 판단하는 능력에서 시험받음
- 📊 최고 점수도 47점으로, 인간 전문가와는 거리가 멂
- 거짓말보다 흔한 것은 '절차가 중간에 끝남'
이 채점표의 이름은 DoGBench입니다. 벤치마크란 간단히 말해, 같은 문제를 풀게 하여 AI의 실력을 점수로 비교하는 시스템을 의미합니다. 이 시스템을 만든 곳은 문서 작성 AI 기업 Promptless이며, Helm이나 PostHog 등 공개 소프트웨어(OSS) 관리자들도 참여했습니다.
흥미로운 점은 단순히 글을 쓰게 하는 것만이 아니라는 것입니다. 실제 리포지토리(프로그램 보관 장소)의 변경 사항을 보여줍니다. 먼저 '설명서를 수정할지, 아무것도 하지 않을지'를 선택하게 합니다. 필요한 경우에만 올바르게 수정할 수 있는지를 보는 것입니다.
문제는 총 292개이며, 약 3분의 1은 '아무것도 하지 않는 것이 정답'입니다. 함부로 수정하지 않는 것도 실력 중 하나라는 설계가 되어 있습니다. 현장에서도 만지지 않는 판단이야말로 사고를 예방합니다. 그 부분을 측정하는 것은 이치에 맞습니다.
원래 설명서는 숨겨져 있고, AI는 답을 베낄 수 없습니다. 채점 항목은 '정확성', '누락 없음', '배치 위치' 등 세밀합니다. 중대한 실수가 하나라도 있으면 60점에서 한계가 있습니다.
채점한 것은 7가지 조합(AI 모델과 그것을 구동하는 도구)입니다. 공개된 117개 문제에서의 결과는 다음과 같습니다.
| AI 조합 | 점수 (100점 만점) |
|---|---|
| Qwen3.8 Max + OpenCode | 47.3 |
| ... | |
| 전부 절반에 미치지 못합니다. 중대한 실수 없이 완성한 비율은 최고 39%에 그쳤습니다. 개발사는 '47점은 전문가의 47%의 능력을 의미하지 않는다'고 부인했습니다. 현재 AI 설명서는 사람의 수정이 전제되어 읽는 것이 안전합니다. |
다만, 제작사 Promptless 자체가 문서 작성 AI를 판매하는 회사라는 점은 감안하여 봐야 합니다.
가장 큰 발견은 실패의 내용입니다. 엉터리 글을 쓰는 환각(Hallucination, AI가 그럴듯한 거짓말을 만들어내는 것)은 6.1%로 소수였습니다. 많았던 것은 다른 종류의 실패였습니다. 문장은 맞지만 절차가 부족하여 독자가 끝까지 도달할 수 없는 경우입니다. 이것이 45.5%에 달합니다.
지금까지의 우려: AI가 작성 → 엉터리가 섞임 (6%)
실제 많은 실패: AI가 작성 → 문장은 맞지만 절차가 부족하여 끝낼 수 없음 (45%)
화살표는 AI가 설명서를 쓰는 흐름을 나타냅니다. 무서운 것은 거짓말보다, 그럴듯해 보이지만 핵심 한 단계가 빠진 경우였다는 점입니다.
흔한 실패는 환각이 아니라, 가장 그럴싸하지만 독자가 작업을 완료할 수 없는 설명이었습니다(논문 요약보다).
왜 누락되는 것일까요. 독자가 실제로 어떻게 사용할지 보지 않고 기능만 설명하기 때문입니다. 결정적인 증거를 찾지 않고 '아마도 이렇게'로 채워 넣습니다. 수정해야 할 다른 페이지를 방치합니다. 주로 이런 이유로 누락되었습니다. 코드와 달리, 설명서는 '맞지만 쓸모없는' 부분이 검사를 통과하기 쉽습니다. 리뷰에서 가장 놓치기 쉬운 부분이라고 느낍니다.
- AI가 작성한 설명서는 거짓말보다 '절차의 누락'을 의심해야 함
- 특히 '이후 어떻게 되는지', '확인하는 방법' 등이 빠지기 쉬움
- 자신이 최근 AI에게 작성하게 한 절차를, 아무것도 모르는 사람의 눈으로 처음부터 실행해 보면 오차가 보임
채점표와 데이터는 공개되어 있습니다. 내용을 보고 싶은 분은 여기서 확인하세요.
논문: dogbench.ai/paper / 코드 및 데이터: GitHub, Hugging Face
※본 기사는 1차 정보 조사를 AI가 수행하고 사실 확인 후 작성 및 공개되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기