6개의 중국 AI 엔진에 CRM 소프트웨어 추천을 요청해 보았다. HubSpot은 단 한 번도 등장하지 않았다.
요약
중국 AI 엔진 6개를 대상으로 글로벌 CRM 브랜드에 대한 인식 및 답변 정확도를 테스트한 연구 결과입니다. HubSpot과 같은 브랜드가 중국 AI 모델에서 공식 명칭 부재, 정보 모순, 컴플라이언스 필터링 등으로 인해 부정확하게 묘사되는 현상을 분석했습니다.
핵심 포인트
- 중국 AI 모델은 글로벌 브랜드에 대해 상충하는 정보를 제공하는 경향이 있음
- 단일 쿼리 결과는 신뢰하기 어려우며 반드시 반복 테스트가 필요함
- 확인 가능한 구체적 사실이 없는 브랜드는 컴플라이언스 필터링 대상이 됨
- 추론 모델은 답변 과정에서 정답을 숨기거나 왜곡할 가능성이 있음
저는 중국의 검색 및 AI 시스템이 글로벌 브랜드를 어떻게 설명하는지를 연구하며 직업 생활을 보내고 있습니다. 스크린샷을 보며 논쟁하는 것에 지쳐, 저는 테스트 프레임워크(harness)를 구축하여 6개의 중국 AI 엔진을 통해 4,704개의 답변을 기록했습니다.
이 포스트는 그중 한 부분인 CRM 카테고리에 관한 내용이며, 결과는 제가 예상했던 것보다 훨씬 더 극단적이었습니다.
설정 (The setup)
8개의 글로벌 CRM 브랜드 (Salesforce, HubSpot, Zoho CRM, Pipedrive, Microsoft Dynamics 365, Freshsales, SugarCRM, Monday CRM) × 42개의 중국어 구매자 질문 × 2회 실행 = 672개의 기록된 답변.
질문은 브랜드 확인, 개방형 카테고리 탐색, 비교, 결정 의도, 위험이라는 다섯 가지 그룹으로 나뉩니다. 이 그룹화는 연구에서 그 무엇보다 중요한 요소임이 드러났습니다.
테스트한 모든 중국 엔진은 OpenAI의 chat-completions 방식을 사용하므로, 수집기(collector)는 의도적으로 단순하게 설계되었습니다:
async function ask(prompt) {
const body = {
model: cfg.model,
...
엔진당 환경 변수(env-var) 하나(Base URL, 모델 ID, 플랫폼 라벨)만 교체하면 동일한 패널이 모든 곳에서 실행됩니다. 전체 연구를 위한 총 API 비용은 5달러 미만이었습니다.
결과 (The result)
개방형 (open) 카테고리 질문(
따라서 대부분의 팀이 수행하는 확인 방식 — "DeepSeek에게 우리에 대해 물어봤는데 괜찮아 보였다" — 는 구조적으로 거짓 양성 (false positive)을 반환합니다. 프롬프트가 모델에게 정답을 건네주기 때문입니다. 구매자가 당신을 만날지 여부를 예측하는 수치는 개방형 (open) 질문이며, 이번 샘플의 경우 모든 카테고리에 걸쳐 23%였습니다.
HubSpot의 84개 브랜드 답변을 읽어본 결과, 세 가지 특징이 두드러졌습니다:
- 안정적인 중국어 명칭의 부재. 모델은 이를 직접적으로 언급합니다: "HubSpot 没有正式的中文名称 (HubSpot은 공식적인 중국어 명칭이 없습니다)." 내 데이터에서 언급되지 않은 모든 브랜드가 이 특징을 공유했습니다.
- 자기 모순적인 이야기. 한 답변은 HubSpot이 중국 지사를 가지고 있다고 주장하는 반면, 다른 세 개의 답변은 시장 철수를 언급합니다. 모델은 이 두 가지를 모두 보유하고 있으며 이를 교차하여 제공합니다. 관리되지 않는 내러티브 (unmanaged narrative) → 모델이 상충하는 파편들로부터 하나의 이야기를 조립해냅니다.
- 컴플라이언스 (Compliance) 필터링. 이 카테고리에서는 128개의 브랜드/리스크 답변 중 61개에 컴플라이언스 주의 사항이 붙어 있었으며, 이는 내가 측정한 것 중 가장 밀도가 높았습니다. Salesforce는 모델이 인용할 수 있는 하나의 구체적인 사실(Alibaba Cloud와의 계약)을 가지고 있기 때문에 필터를 통과합니다. 확인할 수 있는 사실이 없으면 → 일반적인 경고가 출력됩니다.
무엇이 잘못되었는지를 포함한 재현성 노트 (Reproducibility notes)
만약 내가 다른 사람의 이 연구 버전을 읽고 있다면 알고 싶을 사항들:
- 모든 것을 두 번 물어보세요 (Ask everything twice). 개방형 질문 쌍의 18.8%가 같은 날 수행된 두 번의 실행 사이에서 결과가 뒤바뀌었습니다. 단 한 번의 쿼리는 동전을 한 번 던지는 것과 같습니다.
- 추론 모델 (Reasoning models)은 정답을 숨깁니다. Doubao의 플래그십 모델과 여러 Qwen/GLM 변형 모델들은 제가 답변 전용 모드 (answer-only mode)를 강제하기 전까지
reasoning_content에 2,000자를 채운 채content: ""를 반환했습니다. - 타임아웃 (Timeouts)은 가짜 실패를 만들어냅니다. 한 엔진은 타임아웃 시간을 세 배로 늘려야 했습니다. 90초일 때는 오류율처럼 보였지만, 200초일 때는 정상적으로 보였습니다.
- 파일을 신뢰하기 전에 오류를 확인하세요. 한 어그리게이터 (aggregator)가 실행 도중 크레딧이 소진되어 672건의 호출 중 500건을 HTTP 403 오류와 함께 조용히 실패했습니다. 하지만 파일에는 여전히 672줄이 남아 있었습니다.
- 정확한 모델에 날짜를 기록하세요. 연구 중간에 DeepSeek가
deepseek-chat을 완전히 폐기하고 이름 변경을 강제했습니다. 이러한 제품들은 분석 속도보다 더 빠르게 움직입니다. - 모드 (Mode)가 중요합니다. 이것은 API 모델 지식 모드 (model-knowledge mode)이며, 실시간 검색 (live retrieval) 기능이 있는 소비자용 앱이 아닙니다. 측정 도구가 다르면 질문도 달라집니다. 저는 이들을 혼합하는 대신 엔진별로 기록합니다.
데이터 (Data)
집계된 결과와 재사용 가능한 42개 질문 이중 언어 패널은 CC BY 4.0 라이선스를 따릅니다:
https://github.com/David88666/china-ai-visibility-benchmark
자신만의 브랜드와 카테고리를 교체해 보세요. 패널에는 {brand} / {category} / {competitor} 슬롯이 있어, 오후 한나절이면 전체 과정을 재현할 수 있습니다.
만약 국제적인 영향력을 가진 작업을 하고 있다면, 이 테스트의 저렴한 버전을 한 번쯤 실행해 볼 가치가 있습니다. 세 개의 엔진을 대상으로, 현지 언어로 된 다섯 개의 개방형 카테고리 질문을 각각 두 번씩 물어보는 것입니다. 한 시간 정도 걸리며, 모델에게 자신의 이름을 직접 물어보는 것과는 매우 다른 결과를 보여줄 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기