
동일한 Shopify 스토어를 6번 스캔했습니다. 단 하나의 숫자만 바뀌었습니다.
요약
동일한 Shopify 스토어를 6번 반복 스캔하여 AI 평가 시스템의 안정성을 테스트한 실험 결과입니다. 시각적 요소 등 결정론적 지표는 일정했으나, LLM이 평가하는 '의도(Intent)' 점수에서 변동이 발생함을 확인했습니다.
핵심 포인트
- AI 평가 점수의 일부는 모델 분산(variance)에 의한 통계적 노이즈일 수 있음
- 단일 점수 변화가 반드시 실제 성능 개선을 의미하지는 않음
- 신뢰할 수 있는 평가를 위해 반복적인 재스캔과 베이스라인 설정이 필수적임
측정 시스템을 구축할 때, 가장 먼저 답해야 하는 질문 중 하나는 놀라울 정도로 간단합니다.
측정 자체는 얼마나 안정적인가?
우리의 Shopify 스토어인 Founder Lab을 최적화하기 전에, 우리는 기준점(baseline)을 설정하고 싶었습니다.
단 한 번의 스캔이 아닙니다.
여러 번의 스캔입니다.
스토어의 단 1바이트도 변경하지 않은 채로 말이죠.
결과는 예상보다 더 흥미로웠습니다.
실험
우리는 정확히 동일한 Shopify 스토어를 6번 스캔했습니다.
- 7월 12일 기준점(baseline) 스캔 1회
- 7월 17일 재스캔 5회
- 모든 재스캔은 62초 이내에 완료됨
- 스캔 사이에 절대적으로 변한 것은 없음
우리가 측정한 내용은 다음과 같습니다.
모든 결정론적 요소는 동일하게 유지되었습니다
여기서부터 흥미로운 부분이 나타납니다.
모든 결정론적(deterministic) 구성 요소는 정확히 동일하게 유지되었습니다.
| 구성 요소 | 점수 |
|---|---|
| 시각적 (Visual) | 11 |
| ... | |
| 위의 모든 값은 6번의 스캔 모두에서 **비트 단위로 동일(bit-for-bit identical)**했습니다. |
오직 하나의 구성 요소만 움직였습니다.
의도 (Intent).
의도(Intent) 점수는 4에서 6 사이로 변했습니다.
그 외의 모든 것은 일정하게 유지되었습니다.
간단한 관찰
의도(intent) 점수를 빼보십시오.
모든 스캔 결과가 동일해집니다.
78 - 6 = 72
76 - 4 = 72
76 - 4 = 72
78 - 6 = 72
77 - 5 = 72
77 - 5 = 72
점수의 결정론적(deterministic) 부분은 전혀 변하지 않았습니다.
오직 모델이 평가하는 구성 요소만 움직였습니다.
그것은 우리에게 즉각적으로 중요한 사실을 알려주었습니다.
두 스캔 사이의 1~2점 차이가 반드시 스토어가 개선되었음을 의미하지는 않는다는 것입니다.
그것은 단순히 정상적인 모델 분산(model variance)일 수 있습니다.
이것이 중요한 이유
많은 AI 평가 시스템은 단일 점수를 생성합니다.
사람들은 자연스럽게 다음과 같이 비교합니다:
78
대(vs)
80
그리고 무언가 개선되었다고 결론을 내립니다.
우리의 첫 번째 실험은 그것이 항상 사실은 아닐 수도 있음을 시사합니다.
만약 점수의 일부가 결정론적 규칙 (deterministic rules)이 아닌 LLM (Large Language Model)에 의해 생성된다면, 작은 변화는 단순히 통계적 노이즈 (statistical noise)일 수 있습니다.
이는 우리가 향후 실험을 평가하는 방식을 변화시킵니다.
이제 단 한 번의 재스캔 (rescan)을 신뢰하는 대신, 모든 의미 있는 변화에 대해 그것이 실제라고 간주하기 전 여러 번의 재스캔을 요구하게 됩니다.
베이스라인 (The baseline)
어떠한 최적화 (optimization)를 수행하기 전, Founder Lab의 상태는 다음과 같았습니다.
- AI 커머스 점수 (AI Commerce Score): 78 / 100
- 6회 스캔 동안의 점수 범위: 76–78
- 기록된 AI 봇 방문 횟수: 0
- 기술적 점수 (Technical score): 7 / 15 (우리의 가장 취약한 결정론적 요소)
다음에 일어날 일
이것은 우리가 수행할 수 있는 가장 의도적으로 지루한 실험이었습니다.
우리는 아무것도 바꾸지 않았습니다.
그것이 핵심이었습니다.
시스템을 최적화하기 전에, 측정 자체의 노이즈 (noise)가 얼마나 심한지를 먼저 이해해야 합니다.
우리의 다음 실험들은 우선 결정론적 개선 (deterministic improvements)에 집중할 것입니다.
기술적 문제.
구조화된 데이터 (Structured data).
스토어 아키텍처 (Store architecture).
그 이후에야 제품 카피 (product copy)와 의도 신호 (intent signals)를 변경하기 시작할 것입니다.
모든 변경 사항은 여러 번 재스캔될 것입니다.
모든 최적화가 효과가 있을 것이라고 기대하기 때문이 아닙니다.
측정 자체에 노이즈 플로어 (noise floor)가 존재한다는 것을 이제 알기 때문입니다.
그 점을 이해하는 것은 점수 자체를 개선하는 것만큼이나 중요할 수 있습니다.
Founder Lab은 Atom Foundry의 AI 커머스 연구를 뒷받침하는 실시간 Shopify 실험실입니다.
실패한 실험을 포함하여 모든 실험은 공개적으로 게시됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
