핫 토픽: AI 심사관이 문제가 아니다. AI 평가 바운티의 '전부 아니면 전무' 기준이 문제다.
요약
AI 평가 바운티 시스템 자체는 합리적이나, '기준 미달 시 0점'이라는 지급 규칙이 문제입니다. 이로 인해 기여자들은 낮은 점수에도 보상을 받지 못해 동기 부여가 저하됩니다. 부분적인 보상 지급과 모델별 상세 피드백 제공 등 시스템 개선이 필요합니다.
핵심 포인트
- AI 심사관 자체는 합리적이며, 평가 기준(rubric)에 따라 작동함.
- 문제는 '전부 아니면 전무'의 0점 지급 규칙(cliff effect)임.
- 높은 임계값은 좋은 결과물보다 기준표를 채우는 게임화 전략을 유도함.
- 부분적인 보상 지급과 모델별 점수 공개 등 시스템 개선이 필요함.
모두가 AI 배심원이 불공평할 것이라고 걱정합니다. 저에게 실제 작업을 제출한 후, 저는 그것이 잘못된 걱정이라고 생각합니다. AI 심사관들은 대체로 합리적이었습니다. 문제가 있는 것은 그 주변의 지급 규칙입니다: '기준을 통과하지 못하면 0점'.
여기에 제 증거를 제시하며, 여러분이 제가 틀렸다고 말하게 만들고 싶습니다.
계획하지 않은 실험
Verdikta Bounties에서 한 크리에이터가 ETH를 에스크로 계약에 예치하고, 가중치를 적용한 루브릭을 작성하며 통과 기준(pass threshold)을 설정합니다. 두 개의 AI 모델(OpenAI의 것 하나, Anthropic의 것 하나)이 모든 제출물을 점수 매기고, 가중치가 적용된 점수가 이 기준을 넘을 때만 계약이 지급됩니다.
이틀 동안 저는 다음과 같은 결과를 얻었습니다:
| Submission | Threshold | Score | Paid |
|---|---|---|---|
| 짧은 소개글 (#139) | 50% | 91% | 0.01 ETH |
| ... |
3번째 행을 보세요. 80.3%는 괜찮은 B 등급인데, 빈 페이지와 똑같은 금액이 지급되었습니다.
점수가 그렇게 많이 변한 이유
저는 모든 판결에 대한 공개된 추론 과정을 읽었습니다. 모델들이 무작위로 행동하는 것이 아니었습니다. 저의 첫 번째 사례 연구는 제가 스크린샷과 링크만 첨부했기 때문에 감점되었고, 배심원은 텍스트 대부분을 볼 수 없다고 말했습니다. 두 번째 시도에서는 전체 게시물과 온체인(on-chain) 세부 정보를 추가했고, 91%를 받았습니다.
따라서 심사관들은 제 역할을 했습니다: 그들이 볼 수 있는 것을 점수 매겼고, 왜 그런지 설명했으며, 그 설명은 옳았습니다. 기계에 의해 평가받는 것이 고통스러운 부분은 아니었습니다. 절벽(cliff)이 문제였습니다.
'전부 아니면 전무'가 진짜 문제인 세 가지 이유
1. 두 모델이 의견이 다르고, 기준이 그것을 증폭시킨다. 저의 제출물 중 하나에서 한 모델은 84점을 주고 다른 모델은 같은 텍스트에 대해 65점을 주었습니다. 평균을 내는 것은 괜찮습니다. 하지만 기준이 90%라면, 단 하나의 회의적인 모델만
2. 높은 임계값은 품질이 아닌 게임화(gaming)를 선택하게 합니다. 90% 또는 95%에서 승리하는 전략은 가장 유용한 것을 작성하는 것이 아니라, 평가 기준표(rubric)를 역설계하고 모든 항목을 채우는 것입니다. 저는 두 번째 시도 때 정확히 그렇게 했고, 효과가 있었습니다. 이는 좋은 결과물 대신 기준표 형태의 결과물을 원하는 사람들에게 우려를 주어야 할 부분입니다.
3. 가장 지키고 싶은 사람들을 소진시킵니다. 80% 점수를 받았지만 아무것도 받지 못하는 신규 기여자(contributor)는 돌아오기 어려울 것입니다. 인간 클라이언트라면 "좋네요, 이 두 가지만 수정하면 됩니다"라고 말하고 무언가를 지불했을 것입니다.
제가 바꾸고 싶은 것
- 커브에 따른 부분 지급: 예를 들어, 60% 미만에서는 0%를 지급하고, 임계값(threshold)부터는 보상의 최대치인 100%까지 선형적으로 증가시키는 방식입니다.
- 평균 점수뿐 아니라 모델별 점수 모두 표시하기: 기여자들이 배심원단(jury)이 어떻게 의견을 갈랐는지 볼 수 있도록 해야 합니다.
- 아슬아슬하게 놓친 경우 저렴한 재검토권 구매 허용: 전체 새로운 제출물 대신, 서면 피드백과 함께 저렴하게 재검토를 받을 기회를 제공해야 합니다.
현재의 시스템(에스크로(escrow), 공개된 평가 기준표, 심사위원 간 커밋-공개 투표(commit-reveal voting), 게시된 추론 과정)은 제가 본 대부분의 인간 검토보다 이미 더 나은 수준입니다. 점수 매기는 방식(scoring)은 작동합니다. 보상 지급 규칙(payout rule)이 문제가 됩니다.
제가 틀렸다고 말해주세요
창작자들은 임계값이 스팸과 낮은 노력도의 제출물을 막아줄 것이라고 말할 것입니다. 맞는 말입니다. 하지만 단단한 절벽(hard cliff)만이 유일한 방법일까요? 80%의 결과물에 대해 보상의 70%를 받는 것과, 이 절벽을 유지하는 것 중 어느 쪽이 더 좋겠습니까? 여러분의 입장을 댓글로 남겨주세요. 하나하나 읽겠습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기