
왜 단 하나의 AI 답변이 순위가 될 수 없는가
요약
AI 답변의 가변성 때문에 단일 응답만으로 브랜드의 AI 가시성을 판단해서는 안 된다는 점을 강조합니다. 반복적인 테스트를 통해 안정적인 추천 커버리지를 측정하는 것이 중요하며, 질문의 문구와 모델 변동성 등 다양한 변수를 고려해야 합니다.
핵심 포인트
- 단일 AI 답변은 순위가 아니며 결과가 매우 불안정함
- AI 가시성은 반복 실행을 통한 평균 언급률로 측정해야 함
- 모델, 검색 소스, 문맥 등 다양한 변수가 답변에 영향을 미침
- 구매자 프롬프트는 단순 키워드가 아닌 다양한 맥락을 가짐
기존의 소프트웨어 브랜드에 대해 첫 번째 AI 가시성 (AI visibility) 테스트를 실행했을 때, 결과는 거의 완벽해 보였습니다.
해당 브랜드는 브랜드명이 포함되지 않은 모든 구매자 프롬프트 (unbranded buyer prompt)에 나타났습니다.
언뜻 보기에 결론은 명확해 보였습니다:
해당 브랜드는 100%의 AI 가시성을 보유하고 있다.
하지만 결과가 너무 깔끔했습니다.
그래서 저는 동일한 프롬프트를 반복해서 실행했습니다.
숫자가 바뀌었습니다.
반복된 실행 결과, 평균 언급률 (mention rate)은 65%로 떨어졌고, 추천률 (recommendation rate)은 59%로 하락했으며, 브랜드가 일관되게 추천된 경우는 18개의 브랜드 미포함 구매자 프롬프트 중 11개에 불과했습니다.
더 정직한 결과는 100%가 아니었습니다.
그것은 바로:
61%의 안정적인 추천 커버리지 (stable recommendation coverage).
이 실험은 AI 가시성을 어떻게 측정해야 하는지에 대한 제 생각을 바꾸어 놓았습니다.
단일 AI 답변은 유용할 수 있습니다.
하지만 그것은 순위 (ranking)가 아닙니다.
AI 답변이 불안정한 이유
전통적인 검색은 마케터들에게 측정하기에 비교적 익숙한 대상을 제공합니다.
페이지에는 순위 (position)가 있습니다. 그 순위는 변할 수 있지만, 반복해서 확인할 수 있는 검색 결과 페이지가 여전히 존재합니다.
AI 답변은 다릅니다.
응답은 다음과 같은 요소에 따라 달라질 수 있습니다:
- 질문의 문구 (wording);
- 사용 중인 모델 (model) 또는 어시스턴트 (assistant);
- 웹 검색 (web search) 가능 여부;
- 해당 요청 중에 검색된 소스 (sources);
- 날짜 및 위치;
- 이전 대화 문맥 (conversation context);
- 일반적인 모델 변동성 (model variation).
같은 질문을 두 번 던지면 다음과 같은 결과를 얻을 수 있습니다:
- 제품의 순서가 달라짐;
- 최상단 추천 제품이 달라짐;
- 새로운 경쟁자가 등장함;
- 제품의 수가 줄어듦;
- 소스 (sources)가 달라짐;
- 또는 인용 (citations)이 전혀 없음.
이것이 AI 가시성 측정을 불가능하게 만든다는 뜻은 아닙니다.
측정 단위가 단일 스크린샷이 되어서는 안 된다는 의미입니다.
구매자 프롬프트는 키워드가 아니다
또 다른 실수는 카테고리에 관한 모든 질문을 동일하게 취급하는 것입니다.
코드 리뷰 소프트웨어를 찾는 구매자는 다음과 같이 질문할 수 있습니다:
가장 좋은 AI 코드 리뷰 도구는 무엇인가요?
하지만 그들은 다음과 같이 질문할 수도 있습니다:
풀 리퀘스트 (Pull Request)를 머지하기 전에 어떻게 버그를 잡을 수 있나요?
또는:
소규모 엔지니어링 팀을 위한 저렴한 PR 리뷰 도구는 무엇인가요?
또는:
CodeRabbit의 대안은 무엇인가요?
이러한 프롬프트 (Prompts)들은 서로 다른 인지 단계 (Stages of awareness)를 나타냅니다.
카테고리 프롬프트 (Category prompts)
구매자가 이미 제품 카테고리를 이해하고 있는 상태입니다.
문제 프롬프트 (Problem prompts)
구매자가 문제를 가지고 있지만, 어떤 유형의 제품이 이를 해결할 수 있는지는 모를 수 있는 상태입니다.
세그먼트 프롬프트 (Segment prompts)
구매자가 회사 규모, 예산, 워크플로우 (Workflow), 또는 기술 스택 (Technical stack)과 같은 제약 조건을 추가하는 상태입니다.
비교 프롬프트 (Comparison prompts)
구매자가 이미 알려진 제품들을 평가하고 있는 상태입니다.
브랜드는 카테고리 프롬프트에서는 좋은 성과를 낼 수 있지만, 문제 중심의 탐색 (Problem-oriented discovery) 과정에서는 보이지 않는 상태로 남을 수 있습니다.
이러한 차이는 단일 종합 점수보다 더 중요합니다.
브랜드 인지도 (Branded)와 비브랜드 인지도 (Unbranded)의 가시성은 다릅니다
다음 두 가지 프롬프트를 고려해 보세요:
최고의 AI 코드 리뷰 도구
그리고:
CodeRabbit을 사용할 가치가 있을까요?
두 번째 질문에는 이미 브랜드가 포함되어 있습니다.
따라서 언급 (Mention)이 예상됩니다.
그 결과는 구매자가 이미 브랜드를 알고 있을 때 AI 시스템이 해당 기업을 어떻게 설명하는지를 알려줍니다.
하지만 그 결과가 해당 기업을 한 번도 들어본 적 없는 구매자가 기업을 발견할 수 있을지 여부를 알려주지는 않습니다.
이것이 브랜드 인지도 (Branded) 프롬프트와 비브랜드 인지도 (Unbranded) 프롬프트를 별도로 보고해야 하는 이유입니다.
**브랜드 인지도 (Branded visibility)**는 다음을 밝히는 데 도움이 됩니다:
- 평판 (Reputation)
- 반대 의견 (Objections)
- 비교 (Comparisons)
- 인지된 강점 (Perceived strengths)
- 인지된 약점 (Perceived weaknesses)
**비브랜드 인지도 (Unbranded visibility)**는 다음을 밝히는 데 도움이 됩니다:
- 카테고리 발견 (Category discovery)
- 문제 발견 (Problem discovery)
- 신규 고객 확보 (New customer acquisition)
- 브랜드가 고려 대상 (Consideration set)에 포함되는지 여부
대부분의 성장 팀 (Growth teams)에게는 비브랜드 인지도가 더 가치 있는 테스트입니다.
언급되었다고 해서 추천된 것은 아닙니다
AI 가시성 도구들은 종종 여러 결과값을 하나의 숫자로 결합합니다.
하지만 다음 문장들 사이에는 큰 차이가 있습니다:
CodeRabbit은 사용 가능한 여러 도구 중 하나입니다.
그리고:
CodeRabbit은 빠른 풀 리퀘스트 피드백을 원하는 소규모 팀을 위한 최고의 옵션입니다.
첫 번째는 언급 (mention)입니다.
두 번째는 추천 (recommendation)입니다.
또 다른 차이점이 있습니다:
Greptile은 더 깊은 저장소 컨텍스트 (repository context)가 필요한 팀에게 더 나은 옵션일 수 있습니다.
이 답변에서 CodeRabbit이 여전히 논의될 수는 있지만, 추천에서는 다른 브랜드가 승리합니다.
따라서 유용한 AI 가시성 분석 (AI visibility analysis)은 다음 항목들을 분리해야 합니다:
- 누락 (missing)
- 언급 (mentioned)
- 추천 (recommended)
- 최우선 추천 (top recommendation)
- 브랜드 기반 발견 (branded discovery)
- 비브랜드 기반 발견 (unbranded discovery)
- 안정적 및 불안정적 결과 (stable and unstable results)
이러한 구분 없이는, 어떤 브랜드가 실제 구매 추천에서는 지속적으로 패배하면서도 가시성은 매우 높은 것처럼 보일 수 있습니다.
반복 실행이 밝혀낸 것
파일럿 테스트를 위해, AI 코드 리뷰 (code-review) 제품과 관련된 24개의 구매자 프롬프트 (buyer prompts)를 테스트했습니다.
프롬프트는 다음 네 가지 그룹을 포함했습니다:
- 카테고리 발견 (category discovery)
- 세그먼트 및 제약 조건 (segment and constraint)
- 문제 중심 발견 (problem-oriented discovery)
- 비교 및 대안 (comparison and alternatives)
각 프롬프트는 문서화된 동일한 조건 하에 세 번씩 반복되었습니다.
단일 실행 (single-run) 결과는 거의 완벽한 가시성을 시사했습니다.
하지만 반복 실행 결과는 더 미묘했습니다:
- 평균 비브랜드 언급 점유율: 65%
- 평균 비브랜드 추천 점유율: 59%
- 3회 실행 중 최소 2회에서 지속적으로 추천됨: 18개의 비브랜드 프롬프트 중 11개
- 안정적 추천 커버리지 (stable recommendation coverage): 61%
해당 브랜드는 분명히 눈에 띄었습니다.
하지만 그 가시성은 보편적이거나 완벽하게 안정적이지는 않았습니다.
이는 "100% 가시성"이라는 결론보다 훨씬 더 유용한 결론입니다.
안정적인 커버리지는 스크린샷보다 유용하다
두 브랜드가 있다고 가정해 봅시다.
브랜드 A
한 번의 실행 동안 20개의 프롬프트 중 15개에 나타납니다.
프롬프트를 반복했을 때, 단 6개의 추천만이 일관되게 유지됩니다.
브랜드 B
한 번의 실행 동안 20개의 프롬프트 중 11개에 나타납니다.
그 추천 중 10개는 반복 실행 전반에 걸쳐 일관되게 유지됩니다.
단일 실행 보고서는 브랜드 A를 선호할 것입니다.
일관성 우선 보고서는 브랜드 B를 선호할 것입니다.
창업자나 마케터에게는 아마도 브랜드 B가 더 강력한 위치에 있을 것입니다.
이것이 바로 제가 현재 가장 중요하게 생각하는 지표인 이유입니다:
안정적인 추천 커버리지 (Stable recommendation coverage): 반복된 실행 전반에 걸쳐 특정 브랜드가 일관되게 추천되는 구매자 프롬프트 (buyer prompts)의 비율.
이것이 불확실성을 제거해주지는 않습니다.
다만, 불확실성을 가시화해 줄 뿐입니다.
서로 다른 AI 엔진은 서로 다른 발견 환경을 나타냅니다
단 하나의 보편적인 AI 검색 결과란 존재하지 않습니다.
서로 다른 AI 어시스턴트(AI assistants)는 동일한 구매자 프롬프트에 대해 서로 다른 답변을 내놓을 수 있습니다.
이들은 다음과 같은 요소들이 서로 다를 수 있기 때문입니다:
- 모델 (models);
- 검색 시스템 (search systems);
- 소스 (sources);
- 랭킹 신호 (ranking signals);
- 답변 형식 (answer formats);
- 인용 동작 (citation behaviour).
어떤 회사는 한 엔진에서는 강력하게 추천되는 반면, 다른 엔진에서는 거의 언급되지 않을 수도 있습니다.
이로 인해 AI 가시성 (AI visibility)은 최소 세 가지 차원을 갖게 됩니다.
프롬프트 커버리지 (Prompt coverage)
얼마나 많은 구매 상황에서 해당 브랜드가 등장하는가?
반복 가능성 (Repeatability)
동일한 엔진이 반복된 실행 전반에 걸쳐 유사한 결과를 생성하는가?
엔진 간 일치성 (Cross-engine agreement)
서로 다른 AI 시스템이 동일한 회사를 추천하는가?
이러한 차원들은 설명되지 않은 단 하나의 점수 안에 숨겨져 있어서는 안 됩니다.
더 나은 보고서는 시스템이 어디에서 일치하는지, 어디에서 불일치하는지, 그리고 결과가 어디에서 변동성이 큰지를 보여주어야 합니다.
인용(Citations)은 경쟁사가 왜 승리하고 있는지를 드러냅니다
브랜드 언급은 답변에 무엇이 나타났는지를 보여줍니다.
인용은 어떤 소스(sources)가 답변에 영향을 미쳤는지를 드러낼 수 있습니다.
경쟁사는 다음과 같은 요소들에 의해 반복적으로 뒷받침될 수 있습니다:
- 문서 (documentation);
- 독립적인 비교 페이지 (independent comparison pages);
- 리뷰 플랫폼 (review platforms);
- GitHub 저장소 (GitHub repositories);
- 산업 출판물 (industry publications);
- Reddit 토론 (Reddit discussions);
- 고객 사례 (customer stories);
- 카테고리 요약 (category roundups).
이는 소스 격차 (source gap)를 노출할 수 있습니다.
문제는 AI 모델이 특정 제품을 싫어하는 것이 아닐 수도 있습니다.
단순히 해당 카테고리를 설명하기 위해 반복적으로 사용되는 소스들에 그 제품이 누락되어 있는 것일 수 있습니다.
이는 더 실질적인 질문으로 이어집니다:
AI는 경쟁사에 대한 설득력 있는 정보를 어디에서 찾고 있으며, 우리 브랜드는 어디에서 누락되어 있는가?
이 답변은 구체적인 실행 과제를 제시할 수 있습니다:
- 더 명확한 유스케이스 (use-case) 페이지 제작;
- 비교 (comparison) 페이지 발행;
- 문서화 (documentation) 개선;
- 고객 증거 (customer evidence) 추가;
- 문제 중심의 구매자 질문에 답변;
- 관련 제3자 소스 (third-party sources)에 포함되도록 노력;
- 변경 사항 적용 후 테스트 반복.
AI 가시성 (visibility)은 실험으로 취급되어야 합니다
잘못된 워크플로우 (workflow)는 다음과 같습니다:
프롬프트 (prompt) 하나 실행 → 점수 획득 → 축하하거나 패닉에 빠짐.
더 나은 워크플로우는 다음과 같습니다:
- 대표적인 구매자 프롬프트 세트 정의.
- 브랜드 명칭이 포함된 검색 (branded discovery)과 포함되지 않은 검색 (unbranded discovery) 분리.
- 기준점 (baseline) 기록.
- 불안정한 결과를 식별하기 위해 프롬프트 반복.
- 여러 AI 엔진 (engines) 비교.
- 지속적으로 누락되는 구매자 의도 (buyer intents) 파악.
- 어떤 소스 (sources)가 경쟁사 추천을 뒷받침하는지 검토.
- 하나의 구체적인 변경 사항 적용.
- 동일한 테스트 반복.
- 방향성 있는 움직임 측정.
이는 전통적인 순위 추적 (rank tracking)보다 실험 (experimentation)에 더 가깝습니다.
브랜드가 AI 생성 답변 내에서 고정된 위치를 유지할 것이라는 보장은 없습니다.
하지만 가시성이 다음과 같이 변하는지는 관찰할 수 있습니다:
- 더 넓게;
- 더 일관되게;
- 엔진 전반에 걸쳐 더 강력하게;
- 관련 소스에 의해 더 잘 뒷받침되도록.
가장 가치 있는 결과는 종종 누락된 프롬프트입니다
어떤 기업은 이미 다음과 같은 검색어에 나타날 수 있습니다:
최고의 AI 코드 리뷰 도구 (Best AI code review tools)
하지만 다음과 같은 검색어에서는 여전히 나타나지 않을 수 있습니다:
성장하는 엔지니어링 팀이 수동 리뷰 작업량을 어떻게 줄일 수 있는가?
두 번째 프롬프트가 더 큰 기회를 나타낼 수 있습니다.
구매자는 문제를 가지고 있지만, 아직 카테고리나 벤더 (vendor)를 선택하지 않은 상태입니다.
브랜드가 이러한 프롬프트에서 반복적으로 사라질 때, 그 결과는 다음과 같은 유용한 행동으로 이어질 수 있습니다:
- 해당 문제에 관한 콘텐츠 발행;
- 제품을 소개하기 전에 워크플로우 (workflow) 설명;
- 특정 팀 규모에 맞는 자료 제작;
- 제품이 대안들과 어떻게 다른지 명확히 설명;
- 외부 증거 (external evidence) 개선.
이는 "AI 가시성 점수 (AI visibility score)"가 42에서 47로 상승했다는 말을 듣는 것보다 훨씬 실행 가능합니다.
팀이 측정해야 할 것
유용한 AI 가시성 보고서는 다음 질문에 답할 수 있어야 합니다:
- 구매자가 우리를 직접 언급하지 않았음에도 우리가 언급되는 곳은 어디인가?
- 우리가 진정으로 추천되는 곳은 어디인가?
- 우리가 첫 번째 추천 대상이 되는 곳은 어디인가?
- 반복된 실행(runs) 전반에 걸쳐 안정적으로 유지되는 결과는 무엇인가?
- 어떤 엔진이 우리의 경쟁사에게 유리하게 작용하는가?
- 어떤 구매 의도(buyer intents)에서 우리가 지속적으로 밀려나는가?
- 어떤 소스(sources)가 반복적으로 인용되는가?
- 다음에 어떤 변화를 테스트해야 하는가?
목표는 영구적인 AI 순위를 만들어내는 것이 아닙니다.
목표는 무작위적인 스크린샷을 반복 가능한 증거(repeatable evidence)로 대체하는 것입니다.
이 접근 방식이 여전히 증명할 수 없는 것
반복적인 테스트는 결과를 더 방어 가능하게(defensible) 만들지만, 불확실성을 완전히 제거하지는 못합니다.
가시성 스냅샷(visibility snapshot)은 다음 사항을 증명할 수 없습니다:
- 모든 사용자가 동일한 답변을 받게 된다는 점
- AI 어시스턴트가 동일한 브랜드를 계속해서 추천할 것이라는 점
- 인용(citations)이 추천을 직접적으로 유발했다는 점
- 높은 가시성이 자동으로 매출을 발생시킬 것이라는 점
- 콘텐츠 변경이 모든 엔진에 동일하게 개선 효과를 줄 것이라는 점
이것은 여전히 샘플링된 관찰(sampled observation)입니다.
반복의 목적은 거짓된 확신을 만드는 것이 아닙니다.
조사할 만큼 충분히 안정적으로 보이는 결과가 무엇인지, 그리고 어떤 결과가 일회성 변동(one-off variations)이었을 수 있는지를 식별하는 것입니다.
마지막 생각
수년 동안 마케터들은 이렇게 물었습니다:
Google에서 우리의 순위는 어디인가?
이에 상응하는 AI 검색 질문은 다음과 같아서는 안 됩니다:
우리의 ChatGPT 순위는 무엇인가?
더 유용한 질문은 다음과 같습니다:
중요한 구매자 질문들에 대해, AI 시스템은 얼마나 일관되게 우리를 추천하는가—그리고 경쟁사는 대신 어디에서 승리하는가?
단 하나의 AI 답변으로는 그 질문에 답할 수 없습니다.
대표적인 프롬프트 세트(prompt set), 반복된 관찰, 다중 엔진, 그리고 프롬프트 수준의 증거가 그 답에 훨씬 더 가까이 다가갈 수 있게 해줍니다.
공개 연구 스냅샷과 향후 업데이트는 BuyerPrompt에서 확인할 수 있습니다.
공개(Disclosure): 저는 이 글의 구조를 잡고 편집하는 데 AI 글쓰기 어시스턴트를 사용했습니다. 실험, 결과, 해석 및 최종 검토는 저의 고유한 작업입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기