OptimismBench: 언어 모델 판단에서의 낙관 편향(Forecasting Bias)과 정렬 효과(Alignment Effect)
요약
LLM의 확률적 판단에서 발생하는 낙관 편향을 탐지하는 새로운 벤치마크인 OptimismBench를 소개합니다. 16개 모델을 분석한 결과 대다수가 낙관적 편향을 보였으며, 사후 학습(post-training)이 이러한 편향의 방향을 결정함을 밝혀냈습니다.
핵심 포인트
- 낙관 편향 탐지를 위한 역전 쌍(inverted pairs) 프레임워크 제안
- 대부분의 LLM이 낙관적 편향을 보이며, Anthropic 모델에서만 비관주의 관찰
- 사후 학습(post-training)이 모델의 편향 부호를 결정하는 핵심 요소임
- 모델 간 편향 차이가 언어 간 차이보다 훨씬 크게 나타남
- 모델의 정렬(alignment) 과정이 확률적 기울어짐을 유발함
대규모 언어 모델(Large language models, LLM)은 확률적 판단을 통해 후속 선택을 형성하는 의사결정 보조 도구로 점점 더 많이 사용되고 있습니다. 이러한 판단이 체계적인 방향성 편향(directional tilt)을 갖는지 여부는 탐지하기 어려웠습니다. 보정 지표(calibration metrics)는 부호가 없는 오차를 합산하며, 자연스러운 불확실성(naturalistic uncertainty)은 정답 확률(ground-truth probability)을 제공하지 않기 때문입니다. LLM이 스타트업의 성공 확률을 70%로 평가하면서 실패 확률을 15%로 평가한다면, 누락된 15%포인트는 합산 점수로는 포착할 수 없는 왜곡을 드러냅니다.
우리는 역전 쌍(inverted pairs)을 통해 방향성 편향을 탐지하는 OptimismBench를 소개합니다. 각 시나리오는 P(success)와 P(failure)를 모두 유도하며, 두 프레이밍(framings) 사이의 비대칭성은 정답(ground truth) 없이도 부호가 있는 편향 점수(signed bias score)를 산출합니다. 8개 제공업체의 16개 모델을 조사한 결과, 14개 모델이 낙관적(optimistic)인 것으로 나타났으며, 비관주의(pessimism)는 Anthropic의 프런티어 계층(frontier tier)에서만 나타났습니다. 4개 제품군에 걸쳐 베이스(base) 대 채팅(chat) 쌍을 매칭한 11개 사례는 사후 학습(post-training)이 편향의 부호를 결정하며, 제품군에 따라 상반된 변화가 나타남을 보여줍니다. 이러한 패턴은 프롬프트(prompt), 온도(temperature), 관점(perspective), 그리고 자기 편향 제거(self-debiasing) 절제 실험(ablations)에서도 유지됩니다. 17개 모델에 대한 6개 언어 비교 연구는 모델의 정체성이 언어보다 더 지배적임을 보여주며, 모델 간 분산(inter-model variance)은 언어 간 분산(inter-language variance)보다 4.7배 높았습니다. 우리는 모델별 방향성 편향 감사를 위해 10개 언어에 걸친 3,870개의 항목을 공개합니다. 정렬(alignment)이 모델을 더 유용하게 만들 때, 모델의 확률 또한 기울어지며(tilts), 후속 파이프라인(downstream pipelines)은 기본적으로 이 기울어짐을 상속받게 됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기