분류를 위한 LLM 기반 신뢰도 추정의 평가 함정과 희소성 한계
요약
LLM의 분류 작업 시 발생하는 신뢰도 추정의 희소성 문제와 그로 인한 평가 왜곡을 분석합니다. 언어화 방식의 한계를 지적하며, 공정한 평가를 위한 단계적 보간법 표준화와 새로운 개선 방안을 제안합니다.
핵심 포인트
- LLM의 신뢰도 언어화는 매우 희소한 값만을 생성하는 경향이 있음
- 보간법 선택에 따라 AUARC 평가 결과가 극적으로 변할 수 있음
- 공정한 비교를 위해 단계적 보간법(Stepwise interpolation) 표준화 권장
- Verbalization logprobs 방식이 희소성 해결 및 성능 향상에 효과적임
LLM(Large Language Model)이 분류(Classification) 작업에 사용될 때, 예측을 신뢰할 수 있는지 나타내는 신뢰도 추정(Confidence estimation)은 필수적입니다. 그러나 언어화(Verbalization)와 같은 일반적인 접근 방식은 극도로 희소한(Sparse) 출력을 생성합니다. 예를 들어, Qwen3-32B는 SST-2 데이터셋에서 단 8개의 고유한 신뢰도 값만을 언어화하며, 그중 절반 이상이 정확히 95%입니다. 이러한 패턴은 4개의 데이터셋과 2개의 LLM에 걸쳐 일관되게 관찰됩니다. 이러한 희소성은 실용적인 유용성을 제한할 뿐만 아니라, 평가에도 결정적인 영향을 미친다는 것을 우리는 보여줍니다. 즉, 정확도-거부 곡선 아래 면적(AUARC, Area Under the Accuracy-Rejection Curve)에서 보간법(Interpolation)의 선택이 순위를 극적으로 변화시키며, 일관성 샘플링(Consistency sampling)의 순위가 단계적 보간(Stepwise interpolation)과 선형 보간(Linear interpolation) 하에서 최상위에서 최하위로 떨어지기도 합니다. 우리는 더 공정한 비교를 위해 단계적 보간법을 표준화할 것을 권장합니다. 이러한 공정한 평가 하에서, 우리는 언어화된 숫자에 토큰 확률(Token probabilities)을 가중치로 부여하는 방식(우리가 verbalization logprobs라고 명명한 방법)이 희소성 문제를 해결하며, 추가적인 추론 비용(Inference cost) 없이도 가장 높은 AUARC(기본 언어화 대비 +2.3 포인트)를 달성한다는 것을 발견했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기