46%. 13%. 61%. 동일한 데이터, 세 가지 헤드라인
요약
동일한 데이터라도 분모와 시간 범위를 어떻게 설정하느냐에 따라 완전히 다른 메시지를 전달할 수 있음을 경고합니다. 오픈 웨이트 모델의 점유율 사례를 통해 데이터 프레이밍이 비즈니스 의사결정에 미치는 영향을 분석합니다.
핵심 포인트
- 데이터의 분모(denominator)가 무엇인지 반드시 확인해야 함
- 시간 범위(time window) 설정은 의도적인 선택일 수 있음
- 수준(level)과 정점(peak)의 차이를 구분해야 함
- 데이터 프레이밍이 논거를 형성하는 방식을 이해해야 함
세 숫자 모두 사실입니다. 세 숫자 모두 동일한 트렌드를 설명합니다. 그리고 당신이 가장 먼저 본 숫자가 아마도 당신의 믿음을 결정했을 것입니다.
이야기는 이렇습니다: 저렴한 오픈 웨이트 (open-weight) 모델들이 기업용 AI 트래픽을 잠식하고 있습니다. 한 라우팅 플랫폼의 공개 데이터가 이번 달 비즈니스 언론을 통해 보도되었고, 세 가지 버전으로 바이럴되었습니다:
- 46% — 가장 좋았던 단일 주간의 기업용 토큰 (token) 점유율
- 13% — 동일한 모델, 1년 전체 트래픽을 기준으로 측정
- 61% — 엄선된 단일 주간, 상위 10개 모델만을 대상으로 한 점유율
하나의 데이터셋. 세 가지 분모. 세 가지 완전히 다른 헤드라인. 아무도 숫자를 조작하지 않았습니다. 그들은 프레임 (frames)을 선택했을 뿐입니다.
헤드라인이 하지 않은 일을 해봅시다. 동일한 데이터로부터 세 가지를 모두 계산하여 눈앞에서 속임수가 일어나는 과정을 지켜봅시다.
하나의 데이터셋, 세 가지 프레이밍 (framings)
저는 보고된 수치와 일치하는 1년 치 주간 토큰 점유율 데이터를 재구성했습니다. 여기서 중요한 것은 메커니즘이지, 벤더의 원시 로그 (raw logs)가 아닙니다:
import numpy as np
rng = np.random.default_rng(7)
...
프레이밍 1 — 정점 (THE PEAK): 46% (최고의 단일 주간)
프레이밍 2 — 평균 (THE AVERAGE): 13% (52주 전체)
프레이밍 3 — 상위 10개만 (TOP-10 ONLY): 61% (급증한 주간, 필터링된 분모)
프레이밍 3을 자세히 살펴보세요. 세 가지 움직임 중 가장 정교하기 때문입니다. 오픈 웨이트 (open-weight) 토큰에 관한 것은 아무것도 변하지 않았습니다 — 어느 쪽이든 46 유닛입니다. _분모 (denominator)_가 변한 것입니다. 분모의 하단에서 규모가 작은 폐쇄형 (closed) 모델들의 롱테일 (long tail)을 제거하면, 단 하나의 데이터 포인트도 건드리지 않고 46%가 61%가 됩니다. 분자 (numerator)는 정직합니다. 프레임이 곧 논거입니다.
이것이 바로 당신의 대시보드가 당신에게 거짓말을 하는 방식입니다
여기가 제가 실제로 관심을 두는 부분입니다. 왜냐하면 저는 라우팅 플랫폼을 운영하지 않고 당신도 마찬가지이기 때문입니다. 하지만 우리 둘 다 대시보드를 소유하고 있습니다.
당신의 팀원 중 누구도 숫자를 조작하지 않습니다. 그들은 대개 인지하지 못한 채 프레임을 선택할 뿐입니다:
- 피크 주간 (Peak week): 모멘텀을 강조하고 싶을 때 ("채택률이 46%에 도달했습니다!")
- 연간 평균 (Yearly average): 차분함을 유지하고 싶을 때 ("실제로는 13%뿐입니다")
- 필터링된 하위 집합 (A filtered subset): 극적인 효과를 주고 싶을 때 ("중요한 모델들 사이에서는 61%입니다")
동일한 지표. 동일한 정직함. 하지만 세 가지 서로 다른 회의.
어떤 퍼센티지(percentage)도 신뢰하기 전에 내가 파고드는 네 가지 질문
나는 MBA 학생들에게 모든 퍼센티지를 동일한 방식으로 심문하도록 가르치며, 이는 대시보드 검토에도 그대로 적용됩니다:
1. 분모(denominator)가 무엇인가? 정확히 _무엇_에 대한 점유율인가? "상위 10개 토큰의 61%"와 "토큰의 61%"는 같은 숫자를 쓰고 있지만 서로 다른 주장입니다.
2. 시간 범위(time window)는 언제이며, 누가 정했는가? 데이터를 확인한 후에 선택된 범위는 범위가 아니라 선택(selection)입니다. 출시 주간(launch week)이 스스로 자원한 것이 아닙니다; 누군가가 그것을 선택한 것입니다.
3. 이것은 수준(level)인가, 아니면 정점(peak)인가? "46%에 도달했다(Reached 46%)"와 "46%로 운영된다(runs at 46%)"는 끊임없이 동일한 헤드라인으로 뭉뚱그려집니다. 하나는 급증(spike)이고, 다른 하나는 상태(state)입니다.
4. 프레임(frame)을 넓히면 어떻게 되는가? 존재하는 가장 저렴한 강건성 검사(robustness check)입니다:
# 급증 지점 주변의 범위를 넓혀 숫자가 현실을 향해 어떻게 수축하는지 관찰하십시오.
for w in [1, 4, 12, 52]:
lo, hi = max(0, 31 - w // 2), min(52, 31 + (w + 1) // 2)
...
급증 지점 주변 1주일 범위 -> 46%
급증 지점 주변 4주일 범위 -> 20%
급증 지점 주변 12주일 범위 -> 14%
...
단 하나의 for 루프. 46%라는 헤드라인은 네 줄의 출력 결과 속에서 13%라는 현실로 쇠퇴합니다. 만약 어떤 숫자가 더 넓은 범위를 견뎌내지 못한다면, 그 숫자는 결코 핵심(story)이 아니었습니다 — 범위(window)가 핵심이었던 것입니다.
그 아래에 깔린 추세는 여전히 실재한다
솔직하게 말할 가치가 있습니다: 비용 압박은 진정으로 AI 트래픽을 재편하고 있으며, 오픈 웨이트(open-weight) 모델들은 진정으로 점유율을 가져가고 있습니다. 이러한 추세는 프레임 제거(de-framing) 후에도 살아남습니다. 하지만 당신은 프레임을 벗겨낸 후에야 — 차분하고 진실하며, 13%에서 상승 중인 버전 — 그 사실을 알게 됩니다. 결코 가장 큰 숫자를 통해서는 알 수 없습니다.
그리고 해상도(resolution)를 주목하십시오. 왜냐하면 언제나 그렇듯, 이것은 통계학(statistics)의 문제이기 이전에 데이터(data)의 문제이기 때문입니다. 프레임(frame)은 쿼리(query) 안에 존재합니다. 즉, 상위 10개(top-10)를 필터링한 WHERE 절이나, 특정 주를 선택한 날짜 조건(date predicate)과 같은 것들입니다. 쿼리를 작성하는 사람이 곧 논거(argument)를 선택하는 사람입니다. 대시보드 문해력(Dashboard literacy)이란 차트를 읽는 것이 아니라 SQL을 읽는 것입니다.
원칙: 분모(denominator)가 없는 퍼센트(percentage)는 정장을 입은 의견(opinion)에 불과합니다.
여러분이 대시보드에서 발견한 가장 오도하기 쉬운 지표(metric)는 무엇이었나요?
저는 Vinicius Fagundes입니다. 상파울루의 수석 데이터 엔지니어(principal data engineer), 독립 컨설턴트이자 MBA 강사입니다. 저는 데이터 파이프라인(data pipelines)과 그 위에서 작동하는 수학에 대해 글을 쓰며, vf-insights.com을 통해 분기당 몇 개의 프로젝트를 수행합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기