자신의 수치 읽기: AI를 구축하는 사람들을 위한 통계학 복습
요약
AI 모델 및 프롬프트 성능 평가 시 발생할 수 있는 통계적 오류를 경고합니다. 작은 표본의 변동성, 단일 수치 대신 구간(interval) 사용의 중요성, 그리고 평가 과정에서의 흔한 실수들을 다룹니다.
핵심 포인트
- 작은 표본은 변동성이 커서 모집단을 대표하기 어려움
- 단일 수치보다 신뢰 구간(interval)을 함께 보고하여 불확실성 파악
- 피킹(Peeking)과 다중 비교 문제로 인한 데이터 왜곡 주의
- 실제 운영 환경을 반영하는 정확한 지표(분모) 설정 필요
AI 기능을 출시하는 대부분의 팀은 그것을 통계적 주장이라고 부르지 않으면서도 하루 종일 통계적 주장을 하고 있습니다. 평가 점수(eval score)가 71에서 74로 올랐습니다. 새로운 프롬프트가 몇 가지 예시에서 "더 나은 느낌"을 줍니다. 테스트 결과 사용자의 60퍼센트가 버전 A를 선호했습니다. 이 모든 것은 표본(sample)으로부터 모집단(population)에 대해 내린 주장이며, 이는 누군가가 이를 언급하든 안 하든 표본 추출(sampling)의 규칙이 적용됨을 의미합니다.
여기 대부분의 피해를 방지할 수 있는 짧은 복습 내용이 있습니다.
작은 표본이 거짓말을 하는 이유
핵심 문제는 작은 표본은 요동친다는 것입니다. 50명의 사용자에게 어떤 버전을 선호하는지 물었을 때 30명이 A라고 답했다면, 그 60퍼센트는 다음 주에 다시 실행했을 때 반대의 결과가 나올 수 있을 만큼 충분한 흔들림(wobble)을 가지고 있습니다. 당신이 우연히 질문한 50명이 누구였는지를 제외하고는 아무것도 변하지 않았습니다.
이것은 데이터를 불신해야 할 이유가 아니라, 당신이 얼마나 많은 데이터를 가지고 있는지 알아야 할 이유입니다. 대수의 법칙(law of large numbers)은 표본이 커질수록 표본 평균이 실제 값에 수렴한다고 말합니다. 공정한 동전을 열 번 던져서 앞면이 일곱 번 나오는 것은 놀라운 일이 아닙니다. 하지만 만 번을 던지면 그 비율은 0.50에 가깝게 위치합니다. 당신의 40개 프롬프트로 구성된 평가 세트(eval set)는 이 실험의 '열 번 던지기' 버전입니다.
평균이 알려줄 수 없는 것을 구간(Interval)이 알려주는 방식
단일 숫자는 그 자체의 불확실성을 숨깁니다. 구간(interval)은 불확실성을 담고 있습니다.
"74퍼센트"와 "74퍼센트, 플러스 마이너스 6"은 동일한 측정값이지만, 오직 하나만이 지난달에 측정했던 71퍼센트가 해당 범위 안에 있으며 따라서 명확하게 더 나쁘지 않다는 것을 알려줍니다. 구간을 보고하는 팀은 노이즈(noise)와 구별할 수 없었던 변경 사항의 출시를 중단하고, 실제로 효과가 있었던 변경 사항을 되돌리는 일을 멈춥니다.
이 습관은 비용이 들지 않습니다. 숫자(number)를 보고하고, 그다음 구간(interval)을 보고하며, 그다음 그 둘을 만들어낸 표본 크기(sample size)를 보고하십시오.
평가 점수(Eval Scores)가 잘못되는 지점
모델 및 프롬프트 작업에서 세 가지 실패 모드(failure modes)가 반복해서 나타납니다.
첫 번째는 피킹(peeking)입니다. 누군가가 진행 중인 비교 과정을 지켜보다가, 결과가 자신이 원하는 임계값(threshold)을 넘어서는 순간 즉시 중단하는 경우입니다. 높은 지점에서 측정을 멈추는 것은 효과를 부풀리고, 해당 테스트가 제공해야 했던 보증(guarantee)을 조용히 파괴합니다.
두 번째는 다중 비교 문제(multiple comparisons problem)입니다. 동일한 평가 세트(eval set)에 대해 20개의 프롬프트 변형(prompt variants)을 실행하면, 그중 하나는 순전히 우연만으로도 훨씬 더 좋아 보일 것입니다. 만약 그 하나만을 보고한다면, 당신은 노이즈(noise)를 발표한 셈입니다.
세 번째는 잘못된 분모(wrong denominator)입니다. 실행당 비용(Cost per run), 시도당 정확도(accuracy per attempt), 호출당 지연 시간(latency per call)은 모두 실패한 실행이 재시도된다는 사실을 기억하기 전까지는 합리적으로 보입니다. 성공한 작업당 비용(Cost per successful task)이야말로 실제 운영 환경(production)과 맞닥뜨렸을 때 살아남는 수치이며, 이는 대시보드에 표시되는 수치와는 다르게 움직입니다.
핵심 요약 (The Takeaway)
비싼 실수를 피하기 위해 대학원 수준의 통계학이 필요한 것은 아닙니다. 네 가지 습관이 필요합니다: 결과를 보기 전에 표본 크기(sample size)를 결정할 것, 단순한 수치보다는 구간(intervals)을 보고할 것, 실제로 몇 번의 비교를 수행했는지 셀 것, 그리고 당신의 분모가 당신이 중요하게 생각하는 대상과 일치하는지 확인할 것.
그 외의 모든 것은 정교화 과정일 뿐입니다. 이 네 가지가 당신의 변경 로그(changelog)에 적힌 숫자가 의미가 있는지를 결정합니다.
기술 통계(descriptive statistics)와 분포(distributions)부터 가설 검정(hypothesis testing)과 회귀(regression)에 이르기까지 기초 자료를 한곳에서 확인하고 싶다면, 이 가이드가 쉬운 언어로 설명해 줍니다: https://www.learnhowtoscience.com/learn-statistics/
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기