결과가 증거는 아니다: 단 한 번만 내리는 결정을 평가하는 방법
요약
본 글은 단 한 번의 결정에 대한 평가가 결과(outcome)만으로 이루어져서는 안 된다고 주장합니다. 결과는 그 결정이 옳았는지 틀렸는지를 증명하는 '증거'가 될 수 없으며, 대신 과정과 논리적 근거를 중심으로 검토되어야 합니다.
핵심 포인트
- 결과는 단일 추첨에 불과하며, 결정의 오류를 증명하지 못한다.
- 단순히 '잘 되었는가?'보다 '좋았는가?'와 같은 질문으로 분리해야 한다.
- 평가 가능한 것은 결과 자체가 아니라, 선택지, 선택, 신뢰도, 가정 등 과정 기록이다.
- 결과에 대한 검토는 기억에 의존하기 쉬우므로, 사전에 논의된 과정을 문서화하는 것이 중요하다.
결과가 증거는 아니다: 단 한 번만 내리는 결정을 평가하는 방법
20개월 전, 한 회사가 작은 경쟁사를 인수하지 않기로 결정한 적이 있다. 그 경쟁사는 다른 누군가에게 인수되었고, 모델이 예측했던 것보다 빠르게 성장했으며, 현재 분기의 실적이 부진해 보이는 이유가 되었다. 검토 과정에서 사용된 문장은 다음과 같다: 우리는 그것을 잘못했다.
결정 자체가 틀렸을 수도 있다. 하지만 그 결과가 결정의 오류를 증명하지는 않는다.
한 번 내려진 결정은 정확히 하나의 결과를 낳으며, 이 결과는 팀이 샘플링할 기회를 얻지 못한 분포에서 나온 단일 추첨에 불과하다. 만약 어떤 호출(call)이 천 번 반복된다면, 그 비율이 증거가 되고 개별적인 결과는 노이즈가 된다. 하지만 한 번만 발생하는 호출의 경우, 개별적인 결과가 가진 것이 전부이며, 이는 가장 약한 증거이다. 이를 마치 사고에 대한 판결인 것처럼 검토하는 것은 조직이 얻을 수 있는 몇 안 되는 관찰들로부터 잘못된 교훈을 배우게 하는 방식이다.
같은 문장을 담고 있는 두 가지 질문
'그 결정은 좋았는가?'와 '잘 되었는가?'는 서로 다른 질문이다. 높은 빈도의 프로세스에서는 이 둘이 하나로 합쳐진다: 동일한 호출을 명시된 신뢰도로 만 번 수행하면, 좋은 결과의 횟수가 결정 규칙에 대한 테스트가 된다. 이것이 바로 보정표(calibration table)이다. 이는 결정을 비율로 변환하고, 그 비율을 평가할 수 있는 무언가로 변환한다.
한 번 내려진 결정의 경우, 아무것도 합쳐지지 않는다. 그 호출은 명시된 배당률을 가진 베팅이었거나, 아니면 그렇지 않았다. 결과는 뒤집힌 한 장의 카드에 불과하다. 30%의 확률이 도착했다고 해서 실수는 아니고, 우연히 성공한 40%의 호출이라고 해서 승리는 아니다. 만약 당신의 검토가 이 두 문장을 분리할 수 없다면, 그것은 결정을 검토하는 것이 아니다. 그것은 결과를 거꾸로 서술하며 그 서술을 지혜라고 부르는 것이다.
이것은 결과가 중요하지 않다는 주장이 아닙니다. 이것은 결과에게 무엇을 증명해달라고 요구할 수 있는지에 대한 주장입니다. 일회성 결정의 경우, 결과는 무슨 일이 일어났는지 알려줄 뿐입니다. 그것이 일어난 일이 알 수 있었던 것이었는지, 선택지 집합(option set)이 완전했는지, 추론 과정이 유효했는지, 또는 서명한 사람이 충분히 노력했고 운이 나빴는지 여부는 말해줄 수 없습니다.
평가 가능한 유일한 대상은 결과 이전에 작성된 것
결과가 아닌 결정을 검토하려면, 기억하는 방식대로가 아니라 주장되었던 그대로의 주장이 필요합니다. 누군가가 어떻게 끝날지 알기 전에 네 가지가 존재해야 합니다: 실제로 논의된 선택지들(options), 선택 자체(pick), 그 선택에 부여된 신뢰도(confidence), 그리고 명시된 가정들을 포함한 서술적인 이유들입니다.
이 네 가지를 가지고 있다면, 낯선 사람이라도 1년 후에 실질적인 무언가를 할 수 있습니다. 그들은 신뢰도가 정직했는지 물어볼 수 있으며, 이는 답이 있는 질문입니다. 그들은 결론이 제시된 이유들로부터 도출되었는지 물어볼 수 있습니다. 그들은 기록된 가정 중 어떤 것이 틀렸는지 물어볼 수 있는데, 이것은 사후 검토(post-mortem)에서 가장 교육적인 질문입니다. 왜냐하면 사람에 대한 판결 대신 앞으로 가져갈 무언가를 만들어내기 때문입니다.
이것들이 없다면, 검토는 오직 기억일 뿐이고, 기억은 결과로부터 재구성됩니다. 모든 사람은 자신이 의구심을 가졌다고 진심으로 회상할 것입니다. 기록되지 않은 의구심은 증거가 아니며, 그 문장의 정직한 버전은 고통스럽습니다: 과정이 아무런 기록도 남기지 않았다면, 결과만이 평가될 수 있는 유일한 것이므로, 매번 결과가 평가 대상이 되는 것입니다.
신뢰도 숫자가 제공하는 검토의 가치
명시된 신뢰도는 단일 결정을 검토 가능하게 만드는 기록의 일부이며, 이것이 우리가 하나의 헤드라인 수치가 아닌 범위(bands)로 우리의 결과를 발표하는 이유입니다.
수치는 명명된 벤치마크에서 자체적으로 실행되며, 실패는 조용히 재시도되는 것이 아니라 공개됩니다. JudgeBench에서는 총 620개의 판결이 있었고, 이 중 첫 번째로 나온 6개의 오판이 공개되었으며, 그 결과 원본 정확도는 일반적인 직접 기준선(direct baseline)의 92.2% 대비 92.5%를 기록했습니다. 이는 동점이며, 우리는 이를 동점으로 보고합니다. 여기서 중요한 점은 선택이 더 날카롭다는 것이 아닙니다. 유용한 부분은 구간입니다: 우리가 90% 이상의 신뢰도로 보고한 호출은 99.6%의 확률로 맞았고, 80–90% 구간은 94.0%, 70–80% 구간은 84.1%였으며, 70% 미만의 호출은 67.7%의 확률로 맞았습니다.
가장 아래쪽 구간을 검토 지침으로 읽으십시오. 반대 방향으로 나온 67.7%의 판결은 거의 아무것도 알려주지 못했습니다. 이 중 세 가지는 함께 읽었을 때 무언가를 알려줍니다. 반대 방향으로 나온 94%의 판결은 오후 시간을 들여 검토할 가치가 있습니다. 왜냐하면 흥미로운 질문은 결과가 나빴는지 여부가 아니라, 어떤 도구가 무엇을 놓쳤는지이기 때문입니다. 단 하나의 나쁜 결과와 고장 난 프로세스는 서로 다른 발견이며, 오직 명시된 확률만이 사후에 이 둘을 구별할 수 있게 해줍니다.
좋은 소식일 때 결과 편향(Outcome bias)이 더 심각하다
나쁜 소식은 검토됩니다. 실패는 크고, 누군가 회의를 요청하며, 그 결정은 종종 부당하게, 하지만 검토됩니다.
좋은 소식은 전혀 검토되지 않으며, 이것이 더 비용이 많이 드는 실패입니다. 성공은 프로세스를 테스트하지 않고 확인시켜주므로, 조직은 우연히 잘 나온 동전 던지기를 수년간 반복하며 그것을 방법이라고 부를 수 있습니다. 운 좋게 성공한 사람은 불운하게 실패한 사람보다 잘못된 교훈을 더 큰 확신과 함께 배우는데, 왜냐하면 그 무엇도 그들을 모순시키지 않기 때문입니다. 만약 귀하의 사후 검토(post-mortems)가 실패 시에만 작동한다면, 귀하의 프로세스는 한 방향으로만 수정됩니다.
반대의 경우도 더 조용하고 똑같이 해롭습니다. 방어 가능한 결정이 나쁜 결과 때문에 처벌받을 때, 그 공간에서 얻는 교훈은 '더 나은 프로세스를 실행하라'가 아닙니다. 그것은 '숫자가 안 좋을 때 방어 가능한 결정을 내린 사람이 되지 마라'입니다. 이러한 교훈은 어려운 결정을 줄이고, 달력으로 미루는 결정만 늘리며, 이름이 붙은 사람이 위험을 감수하지 않았기 때문에 안전했던 선택지들로 포트폴리오를 만듭니다.
검토가 실제로 물어봐야 할 것
'성공했는지 여부'라는 질문은 여섯 가지 중 어느 것도 아닙니다.
옵션 세트는 완전했는가, 그리고 누가 추가할 수 있었는가? 결과가 미리 알려졌다면 이 결정은 다르게 보였을까, 만약 그렇다면 사전에 실제로 무엇이 기록되었는가? 어떤 확신도가 제시되었으며, 그 결과는 그 범위 안에 있는가? 어떤 서면 가정이 틀렸는가? 당시 결정을 바꿨을 것은 무엇이었을 것이며, 그것은 그때 알 수 있었던 것인가? 그리고 마지막으로: 이 질문에 직면한 다음 사람은 이 기록으로부터 무엇을 얻는가?
마지막 질문이 표준입니다. 검토는 법정(court)이 아닙니다. 그것은 한 결정이 방 안에 있지 않았던 누군가에게 사용 가능해지는 메커니즘이며, 이는 또한 한번 내린 결정이 여러 번 자신에게 비용을 지불하게 하는 유일한 방법이기도 합니다.
실질적인 습관은 작습니다. 회의 전에 반 페이지를 작성하세요: 옵션들, 선택지(pick), 숫자 형태의 확신도, 이유, 그리고 그것을 다시 열게 할 트리거를 적으세요. 날짜를 기입하세요. 회의 후에, 결과를 읽기 전에 그 페이지를 먼저 읽으세요. 이 순서가 전체 규율입니다. 다른 순서로 하면 결과가 당신이 썼다고 생각하는 것을 조용히 다시 쓰게 만듭니다.
판결(verdict)만으로는 검토할 수 없는 이유
여기서 우리의 제품 자체가 걸려 있습니다.
단순한 결론만 내리는 판사는 검토자에게 한 조각만을 넘겨주며, 검토자는 항상 그 조각을 결과에 비추어 해석할 것입니다. 반면, 선택(pick), 보정된 신뢰도(calibrated confidence), 그리고 서면 논거를 제시하는 판사는 검토자가 그것이 어떻게 끝났는지와는 독립적으로 평가할 수 있는 무언가를 넘겨주며, 이것이야말로 답이 단 한 번만 도출될 때 가능한 유일한 종류의 평가입니다.
이 시리즈에서는 어떤 결정이 어느 체제에 속하는지에 대해 몇 주 동안 논쟁해 왔습니다. 이 글은 결정 이후에 무슨 일이 일어나는지에 관한 내용이며, 바로 이곳에서 대부분의 학습이 일어나야 하고 거의 아무런 기록도 남아있지 않은 곳입니다. Decider는 여러분이 단 한 번만 내릴 결정에 사용됩니다: 하나의 질문, 두 개의 후보 답변, 선택(pick), 나중에 검증할 수 있는 신뢰도, 그리고 반박하기에 충분히 길고 또한 현장에 없었던 사람에게 검토받을 만큼 충분히 긴 논거가 필요합니다.
당신은 단 하나의 관찰 결과를 얻게 될 것입니다. 주장을 유지하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기