Polistemics: 정치 및 선거에서 정보 중재자로서의 LLM 평가
요약
정치 및 선거 정보 중재자로서 LLM의 성능을 평가하기 위한 새로운 벤치마크인 Polistemics를 소개합니다. 연구 결과, 최신 모델들은 명확한 정보 상황에서는 신뢰할 수 있으나, 모호하거나 모순된 정보가 주어질 경우 성능이 급격히 저하되는 한계를 보였습니다.
핵심 포인트
- 정치 정보 중재 역량 평가를 위한 Polistemics 벤치마크 제안
- 인식론적 겸손(Epistemic Modesty)을 평가의 핵심 규범으로 설정
- 정보의 모호성 및 모순 발생 시 LLM의 성능 저하 확인
- 정당에 대한 사전 지식과 언어적 특성이 모델 출력에 영향
LLM(대규모 언어 모델)이 시민들이 의존하는 정치 정보를 점점 더 많이 중재함에 따라, 이들이 책임감 있게 역할을 수행하는지 평가할 표준화된 방법이 아직 부재한 상황입니다. 우리는 선거에서 정치 정보의 중재자로서 LLM을 평가하기 위한 이론 기반의 벤치마크인 Polistemics를 소개합니다. 기존 연구들은 이 과업을 중재(mediation)가 아닌 재현(reproduction)으로 취급하여, 그 인식론적 차원(epistemic dimensions)과 불완전한 정보와의 상호작용을 다루지 못했습니다. 우리는 시민의 인식론적 주체성(epistemic agency)에서 도출된 규범적 표준인 인식론적 겸손(Epistemic Modesty)에 평가 근거를 두고, 명확성(clarity), 노이즈(noise), 일관성(consistency)과 같은 정보적 특성이 변화하는 통제된 환경에서 이를 테스트합니다. 2025년 독일 및 네덜란드 선거를 대상으로 세 가지 최첨단(state-of-the-art) LLM에 이 벤치마크를 적용한 결과, 높은 총점(aggregate scores)이 체계적인 실패를 가리고 있음을 발견했습니다. 모델들은 명확한 증거 하에서는 신뢰할 수 있게 중재하지만, 정보가 없거나 모호하거나 모순되는 상황에서는 성능이 무너지며, 정치적 언어의 강도를 평이하게 만드는 경향을 보였습니다. 이러한 실패는 정당에 대한 사전 지식(party priors)에 의해 유도될 가능성이 높으며, 정당 라벨과 출력 언어의 영향을 받습니다. 신뢰할 수 있는 중재는 달성 가능한 것으로 보이지만, 어떤 모델도 이를 일관되게 수행하지는 못했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기