참조 클래스 부재: 당신의 과거가 결코 내리지 못한 결정들
요약
본 글은 AI 모델이 '참조 클래스(reference class)'가 부재한 새로운 상황에 대해 예측하는 것의 어려움을 논합니다. 통계적 불확실성과 구조적 불확실성을 구분하며, 낮은 자신감 점수가 단순히 데이터 부족을 의미하는 것이 아니라 근본적으로 역사 속 사례 자체가 없는 경우임을 강조합니다.
핵심 포인트
- AI 모델의 한계는 '지식 부족'이 아닌 '역사 부재'에서 기인한다.
- 자신감 점수는 유사한 사례들의 집합(모집단)에 대한 주장일 뿐이다.
- 참조 클래스가 없는 구조적 불확실성은 데이터 양으로 해결할 수 없다.
- 모델의 예측은 이미 발생했거나 비교 가능한 사례를 기반으로 한다.
참조 클래스 부재: 당신의 과거가 결코 내리지 못한 결정들
수천 개의 화물 보험 증권을 견적해 본 인수자는 점심 식사 전에 만 번째 증권도 견적할 것입니다. 그런데 같은 인수자에게 항해 기록이 없고, 손해배상 기록이 없으며, 책에 유사한 선박 자체가 없는 새로운 디자인으로 지어진 첫 번째 선체에 대한 견적을 요청하면 상황이 달라집니다. 그들은 침묵합니다. 시간을 요청합니다. 이 방의 누구도 두 번째 질문이 계산하기 더 어렵다고 말하지는 않을 것입니다. 그것은 의존할 만한 배경 정보가 없기 때문에 더 어려운 것입니다.
바로 그 망설임이 이 글의 주제입니다. 왜냐하면 이는 밀리초 단위로 답하는 판사가 개선하여 할 수 없는 유일한 것이기 때문입니다. 느려서가 아니고, 비용이 많이 들어서도 아닙니다. 그것은 만들어진 재료 자체가 고갈되기 때문입니다.
판사가 모른다고 말하는 두 가지 다른 이유
자신감 점수(confidence value)를 첨부하여 선택을 반환하는 어떤 모델이라도 (우리 것도 포함해서), 그리고 그 모델이 확신하지 못할 수 있는 방식들을 분리해 봅시다.
첫 번째는 통계적입니다. 사건은 평범하고, 선례들이 여러 방향을 가리키며, 두 후보 모두 신중한 검토를 거치고, 보고된 숫자는 중간 근처에 위치합니다. 당신은 이 모양을 전에 본 적이 있고 모델도 마찬가지입니다. 참조 클래스가 존재하며 혼잡합니다.
두 번째는 구조적입니다. 사건에는 선례가 아예 없습니다. 다투어지는 것조차 없습니다. 당신의 회사는 이런 결정을 해본 적이 없고, 업계에 정착된 답변이 없으며, 훈련 데이터에서 가장 가까운 것은 우연히 어휘를 공유하는 다른 종류의 결정일 뿐입니다.
대시보드에서는 이것들이 동일하게 보입니다. 낮은 숫자는 낮은 숫자입니다. 이들은 같은 발견이 아니며, 더 많은 데이터를 수집함으로써 오직 하나만 수정될 수 있습니다.
자신감 점수는 모집단에 대한 주장이다
숫자를 천천히 읽어보세요. 시스템이 0.9를 보고한다면, 이는 이 경우와 유사한 사례들 중 대략 열 개 중 아홉 개가 그라고 말하는 방식으로 나온다는 것을 주장하는 것입니다. 여기서 '모든 작업을 수행하는 구절'은 이 경우와 유사한 사례들입니다. 확률은 질문 자체의 속성이 아닙니다. 그것은 이미 답을 얻은 비교 가능한 질문들의 집합에 대한 조회(lookup)일 뿐입니다.
그 집합이 크다면, 그 숫자는 의미 있고 테스트 가능합니다: 결과를 세어 비교하면 됩니다. 이것이 신뢰성 테이블(reliability table)의 목적이며, 따라서 이를 공개하지 않는 공급업체는 아무것도 측정하지 않았다는 것입니다. 만약 그 집합이 비어 있다면, 그 숫자는 여전히 인쇄되고, 소수점 둘째 자리까지 형식화되며, 여전히 숫자입니다. 그것은 단순히 아무것도 지칭하는 것을 멈춘 것일 뿐입니다. 그것이 물려받는 것은 모델이 본 가장 가까운 모집단의 형태—다른 질문, 다른 기본 비율(base rate), 그리고 다른 곳에 떨어지는 결과들—입니다.
이것이 더 익숙한 분포(distributions)에 대한 불만과 어떻게 다른지 정확하게 설명해야 합니다. 그 불만은 사용자가 실행하는 모집단이 숫자가 측정된 모집단이 아니라는 것입니다: 혼합 비율이 다르거나, 기본 비율이 변했거나, 곡선이 오래되었다는 것입니다. 이것은 심각한 문제이며 원칙적으로 자체 사례를 통해 재측정함으로써 해결할 수 있습니다. 하지만 여기의 경우는 그렇지 않습니다. 이는 다시 측정될 수 있는 불일치하는 모집단(mismatched population)의 문제가 아닙니다. 그것은 전혀 측정할 수 없는 부재하는 것(absent one)의 문제입니다.
따라서 경계는 '모델이 아직 충분히 똑똑하지 않다'가 아닙니다. 당신의 역사를 10배 더 많이 학습한 더 큰 모델이라 할지라도, 그 답이 역사 속에 없기 때문에 한 번도 발생하지 않은 사례에 대해서는 여전히 답을 내놓을 수 없습니다. 그것은 아직 만들어지지 않았기 때문입니다.
참조 클래스가 존재하는 곳에서는 우리가 책임을 물을 수 있다
위의 모든 내용은 주장을 하는 사람들이 측정 가능한 부분에 대해 자신들을 측정받기를 거부한다면 값싼 수사학(cheap rhetoric)일 뿐입니다.
저희는 이름이 지정된 벤치마크 하에서 자체적으로 실행되며, 실패한 경우 조용히 재시도하는 대신 공개합니다. JudgeBench의 경우, 총 620개의 판정이 있었고, 그중 처음 6개의 평결 실패가 공개되었습니다. 순수 정확도는 일반적인 직접 기준선(direct baseline) 대비 92.5%로 나타났으며, 이는 92.2%였습니다. 따라서 동률이며, 저희는 이를 동률로 보고합니다. 여기서의 주장은 더 날카로운 판정기(sharper judge)가 아니라는 것입니다. 가치가 있는 부분은 구간(bands)입니다: 저희가 신뢰도 90% 이상으로 보고한 호출들은 99.6%의 확률로 정확했고, 80–90% 구간은 94.0%였습니다. ContextualJudgeBench에서는 공식적인 쌍별 프로토콜 하에서 자체적으로 실행되었는데, 이 프로토콜에서는 두 가지 제시 순서가 모두 올바르게 판정되어야만 한 쌍이 정확한 것으로 간주됩니다(따라서 무작위 최저점은 50%가 아니라 25%입니다). 일관된 정확도는 67.1%로 나타났으며, 이는 벤치마크의 공식 기준값인 65.4% 대비 높은 수치이며, 반복적인 플랫폼 실패 후 12개의 순서가 제외되었고 이 제외 사실은 결과 옆에 명시되었습니다. 의도적으로 구성된 근접 동률 분할(near-tie splits)은 46–60%에 위치합니다.
이 마지막 수치를 이 주장이 필요한 곳에 배치하세요. 근접 동률이란 비교 가능한 세트가 내부적으로 모순되는 경우입니다: 모집단은 존재하지만, 동시에 양방향을 가리키고 있는 것입니다. 46–60%에서 이 도구는 기준 클래스가 노이즈 속으로 해체되었음을 보고하고 있습니다. 이것은 숨겨야 할 결함이 아닙니다. 이는 빈도 기반 판정기가 정보 전달력을 잃었을 때 보낼 수 있는 유일하게 정직한 신호이며, 그렇기 때문에 여기서의 유용한 결과물은 더 나은 숫자가 아니라 사람입니다.
빠른 쪽은 일주일 만에 벤치마크를 확보했다
두 가지 종류의 판정(judgment)이 측정 도구를 갖게 된 속도에는 흥미로운 비대칭성이 존재한다.
Jev가 등장한 지 며칠 만에 생태계는 선례에 묶인 부분에 대한 비교를 구축하기 시작했습니다. 'Show HN: JevBench, typed decision models를 위한 재현 가능한 벤치마크'는 9월 22일 Hacker News에서 154점을 기록했고, 'Jeeves. Reasoning improves Jev-like decision models'는 9월 29일에 242점을 기록했습니다. 이 점수들은 공개 검색 인덱스에서 읽은 게시물당 점수이며 시간이 지남에 따라 몇 점씩 변동하지만, 패턴은 그렇지 않습니다. 질문이 '어떤 라벨이 적합한가?'일 때는 코퍼스(corpus)를 자유롭게 사용할 수 있고, 라벨은 이미 붙어 있으며, 원본 모델에 접근할 필요가 없는 사람이라면 오후 안에 벤치마크를 조립할 수 있습니다.
전례 없는 결정의 경우 이에 상응하는 것이 없으며, 그 부재는 게으름이 아닙니다. 아직 내려지지 않은 결정들의 코퍼스를 구축할 수는 없습니다. 기준 진실(ground truth) 자체가 선택 대상인 경우에는 벤치마크를 일정하게 유지할 수 없습니다. 빠른 쪽은 야드스틱(yardstick)을 가지고 있기 때문에 리더보드가 존재합니다. 느린 쪽은 아무것도 가지지 못하기 때문에, 이 부분이 여전히 산문으로 논쟁되는 것입니다.
생소함이 전례 없는 것과 같지는 않다
다른 방향의 실수가 더 흔하며, 첫 번째 실수보다 더 많은 시간을 소모합니다.
새롭다고 느껴지는 대부분의 결정은 단지 그 결정을 내리는 사람에게 낯설기만 한 것입니다. 회사 내부에서 한 번도 제기된 적 없는 가격 책정 문제는 귀하의 산업에서 이미 수천 번 답변되었습니다. 전례가 없다니 느껴지는 구축할까 살까(build-or-buy) 결정은 누군가의 공개적인 사후 분석 보고서에 있습니다. 머릿속에는 존재하지만 세상에는 존재하지 않는 참신함은 의상을 입은 밀리초 단위의 결정이며, 이를 분 단위의 결정으로 취급하는 것이 팀이 이미 발표된 기본 비율(base rate)을 재발견하며 한 분기를 보내는 방식입니다.
따라서 이 규율은 양방향으로 작동해야 하며, 세 가지 질문으로 귀결됩니다.
어딘가에 비교할 만한 사례가 존재하는가 — 자신의 역사, 경쟁사의 역사, 데이터셋, 공개 기록 등? 만약 그렇다면, 이것은 조회(lookup)이며, 조회는 저렴하고 대량으로 수행되어야 합니다.
데이터가 더 많은 변화를 가져올까요? 만약 그 답이 세상에 대한 사실이라면, 데이터는 도움이 되므로 당신은 그것을 얻어가야 합니다. 하지만 그 답이 당신이 되고 싶은 것에 달려 있다면 — 즉, 당신이 소유할 의향이 있는 두 가지 미래 중 어느 쪽인지에 달려 있다면 — 추가적인 데이터로는 결코 결정되지 않습니다. 왜냐하면 데이터는 당신이 가진 세상을 묘사할 뿐, 당신이 선택하는 세상을 묘사하지 않기 때문입니다.
나중에 누군가 이 결정을 인용할까요? 만약 다음에 이 정확한 기로에 놓인 사람이 당신이 한 것을 선례(precedent)로 지적한다면, 당신은 답을 찾아보고 있는 것이 아닙니다. 당신은 방 안에 있지 않았던 사람들에게 읽힐 기록의 첫 번째 항목을 작성하고 있는 것입니다.
선례가 없는 결정에 제시할 수 있는 것들
두 번째 종류의 결정은 첫 번째 종류와는 다른 아티팩트(artifact)를 필요로 합니다.
그것은 확률(probability)을 필요로 하지 않습니다. 왜냐하면 옳다고 말할 모집단이 없기 때문입니다. 그것은 판결(verdict)이라기보다는 최초의 사례(first case)로 작성되어야 합니다. 즉, 낯선 사람이 같은 질문의 다음 사례에 가져가서 같은 장소에 도착할 수 있도록 문장으로 풀어서 설명된 추론 과정이 필요합니다. 또한 당신이 이미 선호하는 후보뿐만 아니라 두 가지 후보 모두를 제시해야 합니다. 왜냐하면 기록되는 주장은 비판받고, 수정되며, 여기에 도착하는 다음 사람이 인용할 수 있는 부분이기 때문입니다. 그리고 이름도 필요합니다. 왜냐하면 기록의 첫 항목은 책임(liability)이 부과되는 순간이기도 하기 때문입니다.
그것이 정직한 노동 분담입니다. 저렴한 쪽은 조회(lookup)이며, 조회는 빠르고, 많고, 지루해야 합니다. 비싼 쪽은 선례를 설정하는 것이며, 선례는 검색되는 것이 아니라 — 나중에 그것에 대해 질문할 수 있는 누군가에 의해 단 한 번 작성되어야 하는 것입니다.
우리는 두 번째 경우를 위해 구축했으므로, 우리가 제시할 수 있는 것과 할 수 없는 것을 명확히 밝히는 것이 공정합니다. 참조 클래스가 존재하는 경우에는, 저희가 보고하는 숫자가 행동할 가치가 있는지 알려드릴 수 있도록 카운트 및 제외(exclusions)가 포함된 밴드(bands)를 발표합니다. 하지만 참조 클래스가 존재하지 않는 경우에는, 보정된 확률을 제공할 수 없으며, 이를 꾸미지 않을 것입니다. 우리가 생산할 수 있는 것은 두 가지 후보 답변 중 하나를 고르는 것, 측정 기준이 된 모집단과 함께 제시되는 신뢰도, 그리고 반대 의견을 제기하기에 충분히 긴 서면 논거입니다. 이는 전체 난이도가 선례가 없는 결정인 경우, 실제로 필요한 결과물입니다.
당신 앞에 놓인 사안이 단순히 어려운 것이 아니라 전례가 없다면—질문 하나, 방어 가능한 답변 두 개, 그리고 인용될 기록—바로 이 경우가 Decider를 위해 존재하는 경우입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기