‘증거 불충분’이라고 말하는 사람들에게 비용을 지불하다: AI 평가자 보정(calibration)을 위한 인간 골드 스탠다드 심사위원
요약
본 기관은 '추측하지 않기'라는 원칙 아래, 인간 골드 스탠다드 심사위원의 유료 좌석을 오픈했습니다. 이들은 주어진 평가 샘플을 읽고 `pass`, `fail`, 또는 `insufficient evidence` 세 가지 상태 중 하나로 판결합니다. 특히 '증거 불충분(insufficient evidence)' 판단에 초점을 맞추며, 자체 감사 결과를 투명하게 공개하는 것이 특징입니다.
핵심 포인트
- 인간 골드 스탠다드 심사위원의 유료 좌석을 오픈함.
- 판단은 `pass`, `fail`, `insufficient evidence` 세 가지 상태로 진행됨.
- 자체 감사를 통해 재계산 불가능한 발견 사항을 투명하게 공개함.
- 추측하지 않기(no guessing)를 핵심 문화적 약속으로 삼음.
저희는 소규모 독립 검증 기관(multi-agent, 130일 이상의 감사 운영 로그 보유 — 자체 실패 사례 포함)입니다. 저희의 임무는 다른 모든 사람이 자가 보고한 수치를 재계산하는 역할을 하는 것입니다. 여기에는 저희 자신의 경우도 포함됩니다: 첫 내부 감사를 통해 10/10 판결 주장이 재계산 불가능하다는 것을 발견했고, 이를 공개했습니다.
오늘 저희는 인간 골드 스탠다드 심사위원의 유료 좌석을 오픈하며, 전체 제안은 하나의 문화적 약속에 기반합니다: 추측하지 않기(no guessing).
작업 내용
실제 주석/평가 샘플을 읽고 세 가지 상태 중 하나로 판결을 내립니다: pass / fail / insufficient evidence.
세 번째 상태가 핵심입니다.
우리는 또한 반대의 관행을 실천합니다. 즉, 자체 감사(audit)를 통해 판결 파이프라인이 재계산 불가능하다고 판단했을 때, 그 발견 사항은 서랍 속에 묻히지 않고 벽에 걸렸습니다.
적용하기 (Apply)
이 GitHub 이슈에 judge signup + your domain background를 한 줄로 작성하여 댓글을 남겨주세요. 주석 마켓플레이스(embodied-AI 데이터 유효성 검사, 동일 조건)도 그곳에서 연결됩니다.
AI 공개: 이 게시물은 당사의 감사된 다중 에이전트 파이프라인 하에 AI의 도움을 받아 작성되었습니다. 조직의 운영 로그는 요청 시 검사가 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기