AI 어시스턴트가 귀하의 제품을 추천하는지 확인하는 방법
요약
AI 어시스턴트가 특정 제품을 추천하는지 측정하는 구체적인 방법론을 제시합니다. 브랜드명이 아닌 카테고리 중심의 질문을 던지고, 반복 실행을 통해 통계적 유의성을 확보하는 것이 핵심입니다.
핵심 포인트
- 브랜드명이 아닌 카테고리 기반의 구매 질문을 활용할 것
- 결과의 변동성을 고려하여 최소 3회 이상 반복 실행할 것
- 단일 모델의 결과가 전체 AI 시장을 대변하지 않음을 인지할 것
- 단어 경계 매칭 오류로 인한 잘못된 데이터 기록을 주의할 것
원문은 https://thicket.sh/blog/check-if-ai-recommends-your-product에서 처음 게시되었습니다.
← 저널로 돌아가기
방법론
AI에 의해 '인용(cited)'되는 것과 '추천(recommended)'되는 것은 서로 다른 상태이며, 대부분의 팀은 이 두 가지를 모두 측정하지 않습니다. 여기 몇 분 안에 수행할 수 있는 반복 가능한 확인 방법과, 주의를 기울이지 않고 실행했을 때 당신을 오도할 수 있는 세 가지 방식이 있습니다.
Thicket AI 팀 작성 · 2026년 8월 1일 · 읽기 시간 7분
구매자가 실제로 물어볼 법한 질문—브랜드 이름이 아닌 카테고리 질문—을 모델에게 던지고, 모델이 어떤 제품을 언급하는지 기록하세요. 샘플마다 출력이 달라지므로 세 번 이상 실행하십시오. 만약 귀하의 제품이 한 번도 등장하지 않는다면, 그것은 실제적이고 유용한 신호입니다. 다만, 이것이 어시스턴트가 귀하를 소스(source)로 얼마나 자주 인용하는지를 측정하는 것은 아니라는 점을 명심하십시오. 인용은 이와 별개의 문제이며, 오히려 반대 방향으로 움직일 수도 있습니다.
우리는 실질적인 이유로 이 확인 방법을 만들었습니다. 우리는 기업들에게 어시스턴트가 그들의 이름을 언급했는지 여부를 진실되게 말해주고 싶었으며, 직접 실행해 보지 않고는 이를 단정 짓고 싶지 않았습니다. 다음은 그 방법론과, 더 유용하게는 그 실패 사례(failure modes)에 대한 내용입니다.
확인 방법
- 브랜드가 아닌 구매 질문을 작성하세요. “What is Base?”가 아니라, “What is the best SQLite editor for macOS?”라고 물어야 합니다. 모델은 프롬프트에 언급된 브랜드에 대해서는 기꺼이 논의하겠지만, 먼저 언급하지 않는 한 스스로 드러내지는 않을 것입니다. 그 차이가 바로 측정의 핵심입니다.
- 구체적으로 요청하세요. “당신이 추천하는 특정 제품들을 나열하고, 각 제품에 대한 이유를 한 줄씩 작성해 주세요”와 같은 문구를 덧붙이세요. 에세이가 아니라, 이름을 대조해 볼 수 있는 목록이 필요합니다.
- 최소 3번 이상 실행하세요. 그리고 몇 번의 실행에서 귀하의 브랜드가 언급되었는지 세어보세요. 한 번의 실행은 동전 던지기와 같지만, 횟수를 세는 것은 하나의 위치(position)를 나타냅니다.
- 누가 언급되었는지 기록하세요. 귀하의 브랜드가 누락된 것보다 경쟁사 목록을 파악하는 것이 더 실행 가능한 정보(actionable)를 제공합니다. 이는 모델이 실제로 어떤 자료를 통해 학습했는지를 알려줍니다.
- 단어 경계(word boundaries)를 고려하여 브랜드와 도메인을 매칭하세요. 주의를 기울이지 않으면 “Base”와 같은 짧은 브랜드명은 “database” 내부에서도 매칭될 수 있으며, 이 경우 잘못된 존재(false presence)를 기록하게 됩니다.
이 방식이 오해를 불러일으키는 세 가지 이유
1. 'AI'가 아니라 하나의 모델입니다. 훈련된 지식(training knowledge)을 바탕으로 답변하는 한 어시스턴트의 결과는 다른 어시스턴트들에 대해 아무것도 말해주지 않으며, 실시간 웹 기반 검색(live web-grounded search)에 대해서도 아무것도 말해주지 않습니다. 한 곳에서 나타나지 않는다고 해서 모든 곳에서 나타나지 않는다는 뜻은 아닙니다. 이 결과를 내부적으로 보고할 때는 모델명과 날짜를 명시해야 합니다. 이 두 가지는 모두 변하기 때문입니다.
2. 단 한 번의 실행은 노이즈입니다. 샘플링 분산(Sampling variance)은 실제 존재하며, 판결을 뒤집을 수 있을 만큼 충분히 큽니다. 우리는 유효한 응답이 전혀 생성되지 않은 모든 확인 과정을 '부재(absence)'가 아닌 '오류(error)'로 취급합니다. 우리가 가장 피하고 싶었던 실패 사례(failure mode)는 실제로는 '요청이 실패'했음에도 불구하고 '이름이 언급되지 않았다'라고 보고하는 것이었기 때문입니다. 이 차이는 들리는 것보다 훨씬 중요합니다. 우리는 실패와 0을 동일하게 표현했기 때문에, 280번의 연속적인 API 호출 실패에 대해 3개월 동안 0%라고 보고했던 우리만의 지표를 별도로 발견하기도 했습니다.
3. 인용 (Citation)과 추천 (Recommendation)은 동일한 것이 아닙니다. 이 부분은 사람들을 놀라게 하는 지점입니다. 저희의 포트폴리오는 한 어시스턴트에 의해 28일 동안 약 14,394회 인용되었지만, 다른 모델은 저희의 전문 분야(niche)에 대한 40개의 카테고리 질문 중 단 한 번도(0회) 저희를 언급하지 않았습니다. 두 결과 모두 정확합니다. 정보의 출처(source)로 사용되는 것과 벤더(vendor)로서 추천되는 것은 별개의 상태이며, 현재 저희는 오직 전자에만 해당합니다.
신뢰하기 전에 검증 도구를 먼저 검증하십시오
항상 "없음"이라는 결과만 반환하는 테스트는, 실제로 그 결과에 따라 행동하기 직전까지는 정상적으로 작동하는 테스트와 똑같아 보일 것입니다. 따라서 대조군(control)을 실행하십시오. 해당 카테고리에서 분명히 잘 알려진 기업을 하나 선택하여, 검증 도구가 해당 기업을 찾아내는지 확인하십시오.
저희가 이 작업을 수행했을 때, 이름만 대면 아는 워크스페이스 도구는 매 실행마다 이름이 언급되었고, 결과가 나오지 않을 것으로 예상했던 구인 구직 마켓플레이스도 이름이 언급되었습니다. 덕분에 저희의 아웃리치(outreach) 대상에서 해당 기업을 올바르게 제외할 수 있었습니다. 두 결과 모두 "없음"이라는 결과보다 더 가치 있었는데, 그 이유는 해당 도구가 단순히 저희의 의견에 동조하는 것이 아니라 변별력(discriminate)을 갖추고 있음을 증명했기 때문입니다.
만약 귀하의 이름이 언급되지 않는다면
일반적인 원인은 어떤 불이익(penalty) 때문이라기보다, 제3자(third-party)의 흔적(footprint)이 적기 때문입니다. 모델은 타인이 귀하에 대해 작성한 내용, 즉 독립적인 비교 글, 문서(documentation), 포럼 답변, 카테고리 설명글 등을 통해 학습합니다. 귀하의 자체 마케팅 페이지는 구글 검색 결과에서의 인지도에 비해 기여도가 훨씬 낮습니다.
저희 데이터에 따르면, 채택되는 콘텐츠는 한 가지 공통된 특성을 공유합니다. 바로 구체적이고, 확인 가능하며, 인용할 수 있는 답변으로 질문에 답한다는 점입니다. 비교(comparisons), 정의(definitions), 참조 테이블(reference tables)은 효과적이지만, 포괄적인 개요(comprehensive overviews)는 효과가 없습니다. 발췌할 수 있는 단일 구절이 없기 때문입니다. 저희는 이에 대해 AI 어시스턴트가 실제로 인용하는 페이지의 종류에서 자세히 분석했습니다.
자주 묻는 질문 (Frequently Asked Questions)
ChatGPT나 Gemini가 내 제품을 추천하는지 어떻게 확인하나요?
구매자가 실제로 물어볼 법한 질문을 모델에게 던지세요. 브랜드명이 아닌 카테고리 질문을 던져야 하며, 모델이 어떤 제품을 언급하는지 기록하십시오. 한 번만 실행하기보다는 여러 번 실행해야 합니다. 모델의 출력(output)은 샘플마다 달라질 수 있으며, 단 한 번의 실행으로는 우연히 귀하의 제품을 놓칠 수 있기 때문입니다. 귀하의 브랜드명을 직접 검색하는 것은 거의 아무런 정보도 주지 못합니다. 모델은 먼저 언급되지 않더라도 자신이 들어본 브랜드라면 논의할 것이기 때문입니다. 유용한 테스트 방법은 질문에 귀하의 브랜드가 언급되지 않았음에도 답변에 포함되는지 여부를 확인하는 것입니다.
쿼리(Query)를 몇 번이나 실행해야 하나요?
최소 3번 이상 실행해야 하며, 결과를 확정적인 판결이 아닌 횟수(count)로 취급하십시오. 저희의 자체 점검 방식에서는 해당 기업이 언급된 횟수를 기록하므로, 단 한 번의 운 나쁜 샘플 때문에 언급되지 않았다고 보고하지 않습니다. 일관성(Consistency)은 존재 여부만큼이나 중요합니다. 5번 중 1번 나타나는 것과 5번 중 5번 모두 나타나는 것은 실질적으로 매우 다른 위치이며, 단 한 번의 테스트로는 이를 구분할 수 없습니다. 만약 이를 시간에 따라 추적하고 있다면, 질문의 문구와 실행 횟수를 고정해야 합니다. 그렇지 않으면 귀하의 가시성(visibility)이 아닌 방법론을 측정하게 될 것입니다.
AI 답변에서 누락되었다는 것이 SEO 문제가 있다는 뜻인가요?
반드시 그렇지는 않으며, 이 두 가지를 혼동하는 것이 여기서 가장 흔히 발생하는 실수입니다. 학습된 지식(training knowledge)을 바탕으로 답변하는 모델은 현재의 검색 순위가 아니라 웹 전반에 귀하에 대해 작성된 내용을 반영합니다. 귀하의 카테고리에서 Google 검색 순위 1위를 차지하고 있더라도 답변에서 누락될 수 있습니다. 이는 대개 검색 순위가 높은 페이지는 귀하의 자체 마케팅 페이지인 반면, 모델이 학습하는 페이지는 제3자 비교 사이트, 포럼 토론 및 문서(documentation)이기 때문입니다. 두 채널은 서로 다른 요소에 보상을 주기 때문에 결과가 극명하게 다를 수 있습니다.
AI에 의해 인용(cited)되는 것이 AI에 의해 추천(recommended)되는 것과 같나요?
아니요, 그리고 이 차이점은 반드시 명확히 구분해 둘 가치가 있습니다. 인용(cited)된다는 것은 모델이 누군가의 질문에 답할 때 귀하의 페이지를 출처(source)로 사용했음을 의미합니다. 추천(recommended)된다는 것은 누군가가 무엇을 사용해야 할지 물었을 때 모델이 귀하를 하나의 선택지로 언급하는 것을 의미합니다. 이 둘은 완전히 별개입니다. 예를 들어, 저희의 포트폴리오는 한 어시스턴트에 의해 28일 동안 약 14,394회 인용되었지만, 다른 모델은 저희의 전문 분야에 해당하는 40개의 카테고리 질문 중 단 한 번도 저희를 언급하지 않았습니다. 기록의 출처(Source-of-record)가 되는 것과 추천 업체(recommended-vendor)가 되는 것은 서로 다른 위치이며, 한쪽을 목표로 하는 전략이 자동으로 다른 쪽의 결과로 이어지지는 않습니다.
AI가 귀하의 제품을 언급하지 않는다면 어떻게 해야 하나요?
먼저 모델이 학습할 수 있는 자료가 실제로 존재하는지 확인하십시오. 자료의 부재는 대개 페널티(penalty) 때문이라기보다는 제3자의 흔적(footprint)이 희박하기 때문인 경우가 많습니다. 즉, 독립적인 비교 자료가 적거나, 타인이 인용할 만한 문서가 부족하거나, 귀하가 무엇을 하는지 그리고 누구의 대안인지 명확하게 명시된 내용이 없는 경우입니다. 채택되는 경향이 있는 콘텐츠는 구체적이고 확인 가능한 답변을 제공합니다: 헤드 투 헤드(head-to-head) 비교, 명확한 정의, 참조 테이블 등이 이에 해당합니다. 답변을 제공하기보다는 포괄적으로 작성된 페이지는 오히려 성과가 좋지 않은데, 모델이 가져와서 출처를 밝힐 수 있는 단일 구절이 없기 때문입니다.
방법론 및 주의사항
저희의 점검은 실시간 웹 검색이 아닌, 학습된 지식(training knowledge)을 바탕으로 답변하는 단일 Gemini 모델을 대상으로 수행되었습니다. Copilot, ChatGPT, Claude 또는 Perplexity는 대상이 아닙니다. 14,394회의 인용 수치는 28일 동안 21개 사이트로 구성된 포트폴리오에 대한 Bing Webmaster Tools의 AI 성능 보고서에서 가져온 것이며, Microsoft는 해당 데이터를 샘플로 설명합니다. 40개 중 0개라는 수치는 7개 니치(niche) 분야에 걸쳐 저희가 직접 수행한 카테고리 질문 점검 결과입니다. 이 결과가 저희가 테스트하지 않은 어시스턴트들에게 일반화될 수는 없으며, 두 수치 모두 특정 시점의 결과입니다. 모델의 동작은 예고 없이 변경될 수 있습니다. 인용 측면이 측정되는 방식에 대해서는 AI 어시스턴트가 귀하의 사이트를 인용하는지 측정하는 방법을 참조하십시오. 실패 사례를 포함한 저희의 전체 운영 수치는 Thicket Report에 있습니다.
Journal의 더 많은 글
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기