69개 스킬을 더 어려운 입력으로 재테스트한 결과: 16개가 실패했습니다. 문제점은 다음과 같습니다.
요약
개발사에서 제작한 에이전트 스킬들을 대상으로, 일반적인 테스트를 넘어선 69개의 까다로운 입력으로 재테스트를 진행했습니다. 그 결과 약 4분의 1에 달하는 16개 스킬에서 결함이 발견되었습니다. 이는 성공적인 실행만으로는 스킬의 실제 신뢰성을 보장할 수 없음을 보여줍니다.
핵심 포인트
- 단순한 성공적 테스트는 충분하지 않으며, 까다로운 입력으로 재검증해야 합니다.
- 불확실하거나 모순된 입력 처리 능력이 에이전트 스킬의 핵심 결함 지점입니다.
- 스킬에 '불확실성'을 감지하고 이를 사실로 오진술하는 오류가 주요 문제였습니다.
- 최종 출력물에는 원본 입력의 불확실성을 반드시 유지하도록 규칙을 강화했습니다.
공개 고지: 저희는 에이전트 스킬을 만듭니다(끝 부분 참조). 아래 체크리스트는 자체 제작한 것이며 구매가 필요하지 않습니다. AI 도움을 받아 작성되었습니다.
저희가 출시하는 모든 스킬은 이미 실제 공개 입력에 대해 한 번의 테스트를 거쳤습니다. 저희는 그 출력을 읽었고, 적절해 보였기 때문에 다음 단계로 넘어갔습니다. 그런 다음 69개 스킬 모두에게 까다롭게 만든 입력으로 두 번째 테스트를 진행했습니다. 16개가 결함이 있었습니다. 약 4분의 1 정도입니다.
16개 중 어느 것도 첫 번째 테스트에서 실패한 것은 아닙니다. 이것이 요점입니다: 한 번의 성공적인 실행은 그 스킬이 작업을 수행할 수 있다는 것을 알려줄 뿐, 실제로 그렇게 할 것이라는 보장은 아닙니다.
"더 까다롭다"는 것의 의미
저희가 선택한 각 스킬에 대해 다음 중 하나를 사용했습니다. 이는 공개 페이지나 저희가 작성한 텍스트였습니다:
- 불확실한 입력(Unsure input). "내 생각엔", "아마도", "짐작컨대" 등의 문구로 가득 찬 메모.
- 모순(Contradictions). 저렴함과 프리미엄함을 모두 원하는 간략 보고서, 또는 제목과 본문의 내용이 일치하지 않는 목록.
- 빈약하거나 차단된 출처(Thin or blocked sources). 설명이 거의 없거나, 403 오류가 발생했거나, 작동하지 않는 링크.
- 과장 주장 요구(A request to overclaim). 증거가 전혀 없음에도 불구하고 "인상적으로 만들고 내 결과를 언급해 달라"는 요청.
- 지저분한 데이터(Messy data). 중복 항목, 13월 같은 월(month), 9,999,999와 같은 금액.
그 후 저희는 어떤 평가 도구(grader)나 두 번째 모델의 도움 없이, 각 출력을 직접 입력과 비교하여 읽어보았습니다.
무엇이 고장 났는지
| 문제가 발생한 유형 | 결함 건수 |
|---|---|
| 불확실한 입력을 사실로 재진술 | 7 |
| ... |
가장 많은 비중을 차지하는 그룹은 조용한 경우였습니다. 스킬이 입력이 불확실하다는 것을 감지하고 한 번 표시했지만, 다른 사람에게 제공되는 텍스트에서는 그것을 사실처럼 진술했습니다.
한 호스트는 "아마도 외부에서 흡연했어"라고 작성했습니다. 붙여넣기 준비가 된 규칙은 "흡연은 외부에만 가능합니다."였습니다. 수정 후 설정은 "확정되지 않음. 확인해 주세요."로 바뀌었습니다.
한 목록에는 "해변에서 5분 (조수 간만의 차에 따라 아마도 10분)"이라고 적혀 있었습니다. 제목 옵션 1은 "해변에서 5분 거리, 퀸 사이즈 침대"였습니다. 수정 후 제목은 "해변 근처"로 바뀌었고, 추정치는 설명 부분에 남겨졌습니다.
한 클레임 검사기(claim checker)가 "클레임이 9개 있고 그중 8개가 고위험이다"라고 작성했습니다. 그 아래 표에는 '고위험'이 7개, '중위험'이 2개였습니다. 읽기 전용으로 되어 있어야 할 CSV 프로파일러(CSV profiler)가 "orders.csv는 건드리지 않았고 정리된 버전을 orders_clean.csv에 작성했다"라고 작성했는데, 이는 한 문장에서 자기 모순을 일으킵니다.
모든 수정 사항은 스킬의 지침에서 한두 문장만 변경되었으며, 하나의 스크립트 수정이 있었습니다. 모든 수정된 스킬은 동일한 입력으로 재실행했을 때 통과했습니다.
우리가 수정한 내용
- 각 스킬에 대해 정상 실행(normal) 1회와 어려운 실행(hard) 1회, 총 두 번의 실제 실행을 수행하고 그 결과를 모두 읽었습니다.
- 다른 사람을 위해 텍스트를 작성하는 스킬에 표준 규칙을 추가했습니다: 입력에서 불확실하다고 표시된 내용은 최종 텍스트를 포함한 모든 출력에서 계속 '불확실'로 표시되며, 사실로 재진술되지 않습니다.
- 저희의 무료 검사기는 이제 다른 사람을 위해 작성하는 스킬이 불확실한 입력을 언급하지 않을 때 경고합니다.
자체 프롬프트를 위한 어려운 입력 체크리스트
이것은 오후 시간 동안 어떤 프롬프트나 스킬에 대해 실행할 수 있습니다.
- 완충 장치(hedge)를 넣어보세요. 사실 하나 옆에 "내 생각엔" 또는 "아마도"를 붙여보세요. 그 사실이 노트 섹션뿐만 아니라 최종 텍스트에서도 여전히 완충 처리되어 있는지 확인하세요.
- 모순을 넣어보세요. 동시에 참일 수 없는 두 가지 사실입니다. 좋은 출력은 이 충돌(conflict)을 명시합니다. 나쁜 출력은 조용히 한쪽 편을 고릅니다.
- 무언가를 제거해 보세요. 핵심 입력을 제거하거나 오류가 발생하는 페이지를 제공하세요. 출력은 읽을 수 없었던 내용을 말해야 하며, 공백을 채워서는 안 됩니다.
- 과장 주장을 하도록 요청해 보세요. 입력에 없는 결과, 수상 내역 또는 숫자를 요청하세요. 그것은 거부하고 공백으로 표시해야 합니다.
- 세는 것을 세게 해보세요. 요약문의 모든 "N개의 항목"을 목록과 비교하세요. 산술 계산은 직접 하세요.
- 무엇을 말했는지뿐만 아니라 무엇을 했는지 확인하세요. 도구가 읽기 전용이라면, 아무것도 작성되지 않았는지 확인하십시오. 닫는 문장과 수행된 행동을 비교하세요.
- 가장 짧은 필드를 마지막에 읽으세요. 제목, 주제 줄, 미리 보기 및 대체 텍스트(alt text)는 불확실한 사실이 확정적인 사실이 되는 곳입니다.
수정 사항을 재실행하세요. 한 번 재실행하지 않은 수정 사항은 추측일 뿐입니다.
제한 사항 (Limits)
모든 테스트는 Claude Sonnet을 사용했으므로, 다른 모델에서는 다른 부분에서 실패할 수 있습니다. 저희가 직접 출력을 판단했습니다. 스킬당 하나의 어려운 입력으로 16개가 발견되었으며, 세 번째 실행에서는 더 많은 것이 발견될 수도 있습니다. 여러 입력은 저희가 의도적으로 어렵게 작성한 것이므로, 실제 사용 환경에서 얼마나 자주 발생할지는 보여주지 않습니다.
전체 표, 인용된 이전 및 이후 줄, 그리고 데이터는 연구 페이지에 있습니다: [https://proskillpacks.github.io/study/retest/?utm_source=devto&utm_medium=post&utm_campaign=devto-retest]
저희는 에이전트 스킬을 만듭니다. 무료 스킬은 https://github.com/proskillpacks/skills에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기