WorldCup Arena: 라이브 토너먼트를 통한 프런티어 LLM의 전망적, 누출 없는 평가
요약
WorldCup Arena는 데이터 누출 문제를 해결하기 위해 2026 FIFA 월드컵을 활용한 실시간 예측 벤치마크를 제안합니다. 6개의 프런티어 LLM을 대상으로 한 실험 결과, 모델들은 배당률 우승 후보와 유사한 63.9%의 정확도를 보였으나 특정 패턴의 편향성을 나타냈습니다.
핵심 포인트
- 사후적 데이터가 아닌 실시간 예측을 통한 누출 없는(leakage-free) 평가 방식 도입
- 프런티어 LLM들은 경기 결과 예측 시 배당률 우승 후보와 유사한 경향을 보임
- 모델 간 의견 동의 경향이 높아 다수결 투표를 통한 성능 향상이 어려움
- 정보가 풍부한 접전 상황보다 일방적인 경기 상황에서 정확도가 높게 나타남
- 현재 세대 모델들 간의 예측 성능 격차는 전반적으로 좁게 유지됨
대규모 언어 모델(LLM)의 예측 능력을 측정하는 벤치마크는 거의 항상 사후적(retrospective)입니다. 즉, 사건은 이미 발생했고 정답은 웹 어딘가에 존재하며, 평가는 암기(memorisation) 문제로부터 스스로를 방어해야 합니다. 우리는 그 반대의 설계를 보고합니다. 2026 FIFA 월드컵의 39일 동안, 확장된 사고(extended thinking)와 네이티브 서버 측 웹 검색(native server-side web search) 기능을 갖춘 6개의 프런티어 LLM(frontier LLMs)은 매 경기 킥오프 전, 한 번에 한 경기씩 104개 전 경기에 대한 7개 시장 예측 카드, 12개 조 우승자, 그리고 토너먼트 전 통합 풀(outright pool)을 작성하도록 요청받았습니다. 질문이 던져졌을 때는 정답이 존재하지 않았으므로, 이 평가는 필터링이 아닌 구조적으로 누출이 없는(leakage-free) 방식이며, 동결된 아카이브에는 4,494개의 점수가 매겨진 예측이 담겨 있습니다. 이 토너먼트가 입증한 것은 6개 시스템이 공유하는 일련의 행동 양식입니다. 경기 결과에 대해 이들은 평균 63.9%의 정확도를 보였으며, 이는 배당률 상의 우승 후보(bookmaker's favourite)를 지지하는 것과 비슷한 수준입니다. 실제로 이들은 대개 그렇게 행동합니다. 이들은 정답을 맞히는 것보다 서로의 의견에 동의하는 경우가 훨씬 더 빈번하므로, 다수결 투표(majority vote)는 아무런 도움이 되지 않습니다. 이들은 무승부와 득점 예측에 대해 소극적으로 참여하며(under-commit), 점수 예측을 하나의 전형적인 결과에 집중시키는 경향이 있습니다. 정확도는 해당 경기에 대해 얼마나 많은 정보가 알려져 있는지보다는 경기가 얼마나 일방적인지에 따라 달라집니다. 즉, 정보(dossiers)가 가장 풍부한 접전 상황에서는 정확도가 급락하는 반면, 토너먼트 전체에 관한 질문에는 잘 답변합니다. 이 과업에서 현재 세대의 프런티어 시스템들은 뚜렷하게 차별화되지 않습니다. 순위는 중간층의 변동 속에서도 상위권과 하위권이 유지되며, 격차는 전반적으로 좁게 유지됩니다. 브리핑 문서(briefing dossiers), 경기 일정, 공식 결과는 채점 코드와 함께 벤치마크로 공개됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기