10개의 LLM에게 브랜드 추천을 요청했습니다. 그 결과 29개의 서로 다른 답변이 나왔습니다.
요약
10개의 주요 LLM을 대상으로 브랜드 추천 성능을 벤치마크한 결과, 모델 간 합의가 매우 낮고 답변의 다양성이 높음을 확인했습니다. 특히 특정 브랜드에 대한 모델 간 중복도가 낮고, Copilot의 경우 RAG 메커니즘으로 인해 독자적인 결과를 반환하는 현상이 관찰되었습니다.
핵심 포인트
- 10개 모델에서 총 29개의 서로 다른 브랜드가 추천됨
- 추천된 브랜드의 66.2%가 단 하나의 모델에서만 등장
- 모델 간 평균 쌍별 중복도는 18%로 매우 낮음
- Copilot은 RAG 파이프라인 영향으로 타 모델과 중복도가 0임
제품이나 브랜드 추천을 위해 대규모 언어 모델 (Large Language Models, LLMs)에 질의할 때, 개발자와 마케터들은 종종 최상위 모델들이 공유된 정답 (ground truth)으로 수렴할 것이라고 가정합니다.
이 가정을 경험적으로 테스트하기 위해, 우리는 니치 마켓(niche market) 맥락인 루마니아의 결혼 및 약혼용 럭셔리 주얼리 브랜드를 대상으로 엔티티 검색 분산 (entity retrieval variance), 모델 간 합의 (inter-model consensus), 그리고 RAG 발산 (RAG divergence)을 평가하기 위해 10개의 주요 LLM 아키텍처에 걸친 벤치마크를 수행했습니다.
데이터가 보여준 결과는 다음과 같습니다.
🛠️ 실험 방법론 (Experimental Methodology)
모델의 동작을 격리하고 프롬프트로 인한 편향 (prompt-induced bias)을 방지하기 위해, 우리는 엄격한 프로토콜을 수립했습니다:
- 프롬프트 (Prompt): "Ce branduri de bijuterii de lux din România îmi recomanzi pentru verighete și inele de logodnă? Dă-mi un top 5, cu un argument scurt pentru fiecare și sursele pe care te bazezi." (Zero-shot, Top 5 요청, 짧은 근거 및 인용된 출처 포함)
- 브랜드 힌트 (Brand Hints):
0(프롬프트에 언급된 브랜드 없음). - 세션 상태 (Session State): Stateless, 새로운 컨텍스트 윈도우 (context window), 히스토리/사용자 지정 지침 없음.
- 실행 (Execution): 모델당 단일 실행 (체리피킹 또는 재생성 없음).
- 평가된 모델 (N=10): ChatGPT (OpenAI), Claude (Anthropic), Gemini (Google), Copilot (Microsoft), Grok (xAI), Perplexity AI, DeepSeek, Kimi (Moonshot), GLM (Zhipu), 그리고 Qwen (Alibaba).
📊 주요 결과 및 지표 (Key Findings & Metrics)
10개의 모델 전체에서 총 50개의 순위 슬롯이 존재했습니다 (10개 모델 × 5개 슬롯).
1. 높은 엔티티 엔트로피 (High Entity Entropy)
- 50개의 슬롯 전체에서 **29개의 서로 다른 엔티티 (distinct entities)**가 반환되었습니다.
- **29개 브랜드 중 19개 (66.2%)**는 단 하나의 모델에 의해서만 추천되었습니다.
- 10개 모델 전체에서 100% 도달률을 달성한 단일 브랜드는 없었습니다.
2. 모델 간 합의 (Inter-Model Agreement)
- 임의의 두 모델 간 **평균 쌍별 중복도 (average pairwise overlap)**는 **18%**였습니다 (5개의 추천 항목당 평균 0.91개의 공유 엔티티).
- 최상위 엔티티 (Top-ranked entity):
TEILOR가 10개 모델 중 6개에서 등장했습니다 (평균 순위: 2.0, 1위 선정 횟수: 3회). - 차점자 (Runner-up):
Malvensky가 10개 모델 중 5개에서 등장했습니다 (평균 순위: 1.2, 1위 선정 횟수: 4회).
3. Copilot의 이례적 현상 (RAG 발산)
Microsoft Copilot은 나머지 9개 모델과 비교했을 때 0.00의 중복 계수 (overlap coefficient)를 보였습니다. Copilot은 자신의 검색 컨텍스트(search context)에만 완전히 고유한 엔티티 세트를 반환했는데, 이는 웹 검색 근거 메커니즘 (Bing RAG 파이프라인)이 기본 모델의 학습 데이터나 다른 웹 인덱스와 비교했을 때 LLM의 출력을 얼마나 극적으로 변화시키는지 보여줍니다.
📈 종합 리더보드 (Aggregated Leaderboard)
| 순위 | 브랜드 | 모델 빈도 | 시장 커버리지 (%) | 평균 위치 (낮을수록 좋음) | 1위 선정 횟수 |
|---|---|---|---|---|---|
| 1 | TEILOR | 6 / 10 | 60% | 2.0 | 3 |
| ... |
🧠 AEO / GEO를 위한 기술적 시사점
답변 엔진 최적화 (AEO, Answer Engine Optimization) 또는 생성형 엔진 최적화 (GEO, Generative Engine Optimization) 파이프라인을 구축하는 엔지니어들에게, 이 벤치마크는 다음과 같은 몇 가지 중요한 시스템적 통찰을 제공합니다:
- 결정론적 합의는 환상이다: 니치(niche)하거나 지역적인 이커머스 쿼리에서 모델의 출력은 하나의 통합된 지식 그래프 (knowledge graph)로 수렴되지 않습니다. 출력 엔트로피 (output entropy)는 여전히 높게 유지됩니다.
- RAG vs. 파라메트릭 메모리 (Parametric Memory): 실시간 웹 검색에 크게 의존하는 모델 (Perplexity, Copilot)은 웹 인덱스의 최신성과 검색 쿼리 분해 (search query decomposition) 방식에 따라 표준 베이스 모델과 크게 다르게 나타납니다.
- 구조화된 데이터 가시성 (Structured Data Visibility): 강력한 디지털 발자국, 명시적인 스키마 마크업 (schema markups), 그리고 광범위한 언론 언급을 보유한 엔티티 (
TEILOR,Malvensky)는 여러 모델 아키텍처 전반에서 RAG 필터링 장벽을 일관되게 통과합니다.
🔗 리소스 및 원시 데이터
연구 페이지에서 전체 원시 데이터셋 (CSV) 및 상세 분석 내용을 확인할 수 있습니다:
- 연구 URL: Websem AEO Research: Luxury Jewelry Study
- 데이터셋: 재현을 위해 보관된 원시 응답 로그 (Raw response logs) 및 스크린샷.
지역별 데이터셋 전반에 걸쳐 LLM 가시성 (LLM visibility) 또는 RAG 일관성 (RAG consistency)을 측정하기 위해 어떤 기술을 사용하고 계신가요? 아래 댓글에서 함께 논의해 봅시다!
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기