SocietyBench: 반사실적 사회 세계 진화 예측 (Forecasting Counterfactual Social-World
요약
LLM의 사회적 사건 이해 및 예측 능력을 측정하기 위한 새로운 벤치마크인 SocietyBench를 소개합니다. 실제 사건을 반사실적(counterfactual) 시나리오로 변환하여 모델의 사전 학습 지식 개입을 차단하고, 확률 교정과 시간적 정확도를 기준으로 모델의 능력을 평가합니다.
핵심 포인트
- 사회적 사건의 흐름을 예측하는 LLM의 능력을 측정하는 엔드 투 엔드 벤치마크 제안
- 사전 학습 데이터를 배제하기 위해 고유 명사와 날짜를 변환하는 반사실적 방법론 적용
- 프런티어 LLM들도 사회적 사건의 시간적 정확도와 확률 교정 측면에서 한계를 보임
- 에이전트 프레임워크가 베이스 모델의 성능을 개선하는 데 실패함을 확인
- 익명화된 타임라인, 질문 은행, 채점 코드를 모두 공개
대규모 언어 모델 (LLMs)과 그 위에 구축된 에이전트들은 현재 버그 수정, 브라우저 제어, GUI 조작과 같이 특정 작업을 완수할 수 있는지에 대해 집중적으로 벤치마킹되고 있습니다. 이와 상호 보완적인 사회적 능력, 즉 모델이 실제 사회적 사건이 전개되는 방식을 얼마나 잘 이해하고 예측하는지에 대해서는 거의 측정되지 않았습니다. 우리는 한 줄의 이벤트 주제를 입력받아 5개 플랫폼의 웹 뉴스 및 소셜 미디어 게시물을 수집하고, 이를 사실적 사건과 여론 레이어를 분리하여 날짜별로 인덱싱된 타임라인으로 추출한 뒤, 해당 타임라인의 모든 절단 날짜(cutoff date)를 검증된 예측 질문 은행으로 변환하는 엔드 투 엔드 (end-to-end) 벤치마크인 SocietyBench를 소개합니다. 질문은 두 개의 직교하는 100점 만점 축인 확률 교정 (probability calibration)과 시간적 정확도 (temporal accuracy)를 기준으로 점수가 매겨집니다. 모델이 타임라인을 보기 전에, 3단계 절차를 통해 모든 고유 명사를 교체하고 모든 날짜를 이벤트별 상수로 이동시켜, 실제 흐름을 구조적으로는 동일하지만 모델이 사전 학습 (pre-training) 메모리와 대조할 수 있는 표면적 라벨이 제거된 반사실적 (counterfactual) 사회 세계로 변환합니다. 중국어 및 영어 판의 5가지 이질적인 이벤트와 125개의 예측 지점에서, 6개의 프런티어 (frontier) LLM 중 가장 강력한 모델조차 단순 기준점인 50점 대비 100점 만점에 75.0점에 그쳤습니다. 두 축은 서로 분리됩니다. 즉, 모델이 교정 능력은 뛰어나지만 시간적 정확도는 낮을 수 있고, 그 반대의 경우도 발생할 수 있습니다. 공유된 베이스 모델을 기반으로 구축된 세 가지 에이전트 프레임워크는 해당 베이스 모델보다 성능을 개선하는 데 실패했으며, 두 가지 모델 프리 (model-free) 휴리스틱은 모든 LLM보다 뒤처졌습니다. 단일 축에서 이벤트별 격차는 최대 21.4점에 달하며, 이는 우리가 단일 이벤트가 아닌 여러 이벤트를 통해 평가해야 한다는 주요 근거입니다. 모든 익명화된 타임라인, 질문 은행, 정답 (ground truth) 및 채점 코드가 공개됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기