위키피디아 초록 기반 $ ext{log}(N)$-질문 게임에서 성능 평가: 페어드 프론티어 모델 간의 통신 효율성
요약
본 연구는 두 에이전트가 참여하는 $\log_2 N$-Questions 게임을 통해 여러 프론티어 언어 모델의 정보 소통 효율성을 평가했습니다. 질문자(questioner)와 답변자(answerer) 역할을 수행하며, 이 테스트는 정보 비대칭성 하에서 모델 간의 자체 통신 능력을 측정합니다. 테스트 결과, Claude Opus 5가 다른 모델들보다 현저히 낮은 성능을 보였으며, 상위 다섯 개 모델들은 비슷한 수준의 성능을 나타냈습니다.
핵심 포인트
- $\log_2 N$-Questions 게임으로 LLM 간 정보 소통 효율성 측정
- Claude Opus 5는 테스트에서 상대적으로 낮은 승률을 기록함
- 상위 5개 모델은 세트 크기 증가에 따라 비슷한 성능 감소 추세를 보임
- 질문당 정보량과 모델의 승률 사이에 높은 상관관계가 확인됨
우리는 두 에이전트가 참여하는 $ ext{log}(N)$-Questions 게임에 대해 여섯 개의 프론티어 언어 모델을 평가했습니다. 질문자(questioner)는 $N$개의 위키피디아 리드 단락을 보고, 정확히 $ ext{log}_2 N$개의 예/아니오 질문을 사용하여 비밀리에 선택된 목표를 식별해야 합니다. 답변자(answerer)는 오직 목표와 질문만을 보고 한 단어로 답합니다. 두 역할 모두 동일한 제공업체에서 실행되므로, 이 게임은 정보 비대칭성 하에 모델이 스스로에게 얼마나 잘 소통하는지를 측정합니다. 우리는 4개부터 1024개 단락까지의 문서 세트에 걸쳐 총 408개의 게임을 진행했으며, 총 API 비용은 $363였습니다. 한 모델이 다른 모델들보다 현저히 낮은 성능을 보였습니다: Claude Opus 5가 68게임 중 28게임을 승리하여 GLM-5.3, GPT-5.6 Sol, Grok 4.6, Gemini 3.8 Flash, Kimi K3의 45~56승에 대비했습니다. 선두 그룹 다섯 모델은 겨우 구별할 수 있을 정도였습니다. 이 다섯 개 모델을 종합했을 때, 승률은 세트 크기가 커질수록 $r=-0.973$으로 감소하며 단일 라운드 신뢰도 매개변수로 적합합니다. 그 형태는 $ ext{win}=p^{ ext{log}_2 N}$이며 $p=0.928$입니다. 손실은 답변 오류와 판별 실패로 대략 동등하게 나뉘며, 모델들은 거의 항상 자신들이 증거로 제외하는 문서를 이름으로 언급하지 않았습니다. 가장 약한 모델의 모든 만장일치 답변 오류를 검사한 결과: 34개 중 32개가 '아니요' 답변이었으며, 이는 문서의 첫 번째 문장에 명시된 속성에 관한 것이었고, 명시적으로 '아니요'로 기본값 설정하는 것을 경고하는 지침 하에 이루어졌습니다. 질문당 정보량은 답변 균형을 통해 추정되었으며, 승률과 $r=+0.88$의 상관관계를 보였습니다. 질문당 전체 비트(full bit)를 추출할 수 있는 유일한 두 모델만이 문서 제목으로 분할하는 전략을 사용했는데, 이 전략은 $N{=}32$ 미만에서는 부재하며 그 이상에서는 4분의 1의 질문에서 사용되었습니다. 추론에 사용된 토큰 지출량은 모델 간에 $4.5 imes$ 차이가 있었으나 성공률과는 거의 관련이 없었으며, 신뢰도 향상과 일치하는 이득 없이 후보 세트가 줄어들면서 트레이스(trace)는 증가했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기