참값(Ground Truth) 없이 유효성 검증하기: 진술적 선호 경제학이 언어 모델 평가에 제공하는 것
요약
본 글은 정답이 없는 복잡한 문제(예: 정책 가치 평가)에 대한 LLM 평가 방법론으로 '진술적 선호 경제학'을 제안합니다. 이 프레임워크는 내용/구성/기준 타당도, 신뢰성 등 기존의 통계적 개념들을 활용하여 모델의 답변 유효성을 검증하는 방법을 제시합니다.
핵심 포인트
- LLM 평가에 정답이 없는 문제(가치 판단)를 적용할 수 있는 방법론을 제시함.
- 진술적 선호 경제학의 타당성 개념들(내용, 구성 등)을 LLM 평가 프레임워크로 확장함.
- 경제 이론 기반의 유효성 테스트를 통해 모델 간 성능 차이를 명확히 구분할 수 있음을 시연함.
현재 대규모 언어 모델(LLM)에 던져지는 많은 질문들은 점수를 매길 수 있는 정답이 없습니다. 즉, 어떤 정책의 가치가 얼마인지, 사용자가 어떤 옵션을 선택해야 하는지, 서로 경쟁하는 가치들을 어떻게 가중할지에 대한 문제입니다. 진술적 선호 경제학은 수십 년 동안 이러한 문제에 직면해 왔습니다. 이는 실제 가치를 알지 못하더라도 설문조사 응답을 평가하며, 유효성(validity)과 관련된 개념들—내용 타당도(content validity), 구성 타당도(construct validity), 기준 타당도(criterion validity), 신뢰성(reliability), 인센티브 호환성(incentive compatibility), 그리고 결과성(consequentiality)—의 틀을 통해 이루어집니다. 우리는 이 프레임워크가 언어 모델을 평가하기 위한 일반적인 방법론이라고 주장하며, 각 개념이 LLM 평가에 어떤 의미를 가지는지 제시합니다. 우리는 발표된 수질 진술적 선호 경제 가치평가 설문조사(Vossler et al. 2023)를 사용하여 이 접근 방식을 여섯 개의 모델에 적용하여 시연합니다. 이 경제학적 응용에서, 유효성 검정은 경제 이론으로부터의 예측 형태를 취합니다: 수요는 하락하는 기울기를 가져야 하며, 지불 의향(willingness to pay)은 상품의 범위와 소득에 반응해야 합니다. 이러한 테스트들은 모델들을 명확하게 구분합니다. 두 개의 구형 모델은 가구 소득 수준 $75,000에서 가장 기본적인 테스트를 통과하지 못했고, 가장 최신인 두 모델은 우리가 점수화할 수 있는 모든 이론적 유효성 테스트를 통과했지만, 수렴 타당도(convergent validity)에서는 차이를 보였습니다. 유효성 테스트를 통과한다는 것은 모델의 답변이 일관성이 있다는 것을 보여줄 뿐, 그것들이 정확하다는 것을 의미하지는 않습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기