
야오진강 교수가 국내 8대 AI 플랫폼 검색 인용 데이터를 오픈소스화했습니다.
요약
야오진강 교수가 8대 AI 플랫폼의 검색 인용 데이터를 포함한 대규모 오픈소스 데이터셋을 공개했습니다. 이 데이터셋은 주요 플랫폼의 인용 패턴을 분석할 수 있는 정량적 지표를 제공하여 AI 최적화 연구를 돕습니다.
핵심 포인트
- 620개 표준 질문과 19만 건의 AI 인용 기록 포함
- Doubao, DeepSeek 등 주요 플랫폼 데이터 포괄
- 최상위 출처의 높은 인용 기여도 확인
- GEO(생성형 엔진 최적화) 전략 수립을 위한 실측 데이터 제공
- AI 인용 연구의 정량화 및 재현 가능성 확보
야오진강(姚金刚) 교수가 국내 8대 AI 플랫폼의 검색 인용 데이터를 오픈소스로 공개했습니다.
이 데이터셋은 620개의 표준 질문과 약 19만 건의 중복 제거된 AI 인용 기록을 포함하며, Doubao, DeepSeek, Kimi, Qianwen, Wenxin 등 주요 플랫폼들을 포괄합니다.
원시 데이터(raw data), 정제 규칙(cleaning rules), 필드 사전(field dictionary)이 모두 오픈소스로 공개되었으며, 첫 번째 시각화 분석 보고서와 arXiv 논문도 함께 제공됩니다.
초기 발견 사항은 매우 명확합니다. 최상위 출처 효과가 매우 강하며 (Top 10이 41%의 인용 기여), 플랫폼 유형 콘텐츠의 가중치가 높고, 브랜드 공식 웹사이트 자체 콘텐츠의 가시도는 4.33%에 불과하며, 크로스 플랫폼 합의도 역시 낮은 편이고, 신선한 콘텐츠가 명확하게 선호됩니다.
이전에는 중국어 GEO(Geographical Entity Optimization) 작업을 할 때 경험과 소량 테스트에 의존했지만, 이제 이 정도 규모의 공개 실측 데이터가 생겼다는 것은 모두가 추측하는 대신 실제 분포를 기반으로 전략을 세울 수 있다는 의미입니다.
데이터가 오픈소스로 공개되면서 연구와 최적화는 '블랙박스'에서 정량화되고 재현 가능한 영역으로 바뀌었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @berryxia (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기