소형 언어 모델(Small Language Models)의 언어화된 불확실성(Verbalized Uncertainty)에 대한 증명 가능한
요약
본 연구는 소형 오픈 웨이트 언어 모델이 답변의 신뢰도를 명시적으로 표현하는 것이 위험 제어형 유예(risk-controlled deferral)를 지원할 수 있는지 탐구합니다. 11개 지시어 튜닝 모델을 대상으로 ARC-Challenge 및 TruthfulQA에서 평가한 결과, 보정 기법들이 제공할 수 있는 범위에 대한 세 가지 이론적 한계를 제시했습니다.
핵심 포인트
- 언어화된 신뢰도는 위험 제어형 유예를 지원하는 핵심 요소입니다.
- 엄격하게 단조로운 보정은 위험-커버리지 프런티어를 보존합니다.
- Platt 스케일링을 사용해도 높은 수준의 인증된 자율성은 제한적입니다.
소형 오픈 웨이트 언어 모델(Small open-weight language models)은 점차 개인적이고, 오프라인이며, 비용에 민슐한 환경에서 실행되고 있으며, 여기서 핵심적인 배포 문제는 모델이 무엇을 답변하느냐뿐만 아니라 언제 인간에게 답변을 유예(defer)해야 하는가입니다. 본 연구에서는 언어화된 신뢰도(verbalized confidence)가 위험 제어형 유예(risk-controlled deferral)를 지원할 수 있는지 조사하며, 0.5B에서 14B 파라미터 규모의 세 가지 제품군에 속하는 11개의 지시어 튜닝(instruction-tuned) 모델을 대상으로 ARC-Challenge 및 TruthfulQA에서 25,168개의 로컬 예측을 통해 평가합니다. 세 가지 이론적 결과는 보정(calibration)이 제공할 수 있는 범위를 제한합니다: 엄격하게 단조로운 보정(strictly monotone calibration)은 위험-커버리지 프런티어(risk-coverage frontier)와 오류 탐지 AUROC를 보존합니다; 온도 스케일링(temperature scaling)은 신뢰도가 0.5 이상으로 유지되면서 정확도가 0.5 미만으로 떨어지는 모델을 보정할 수 없습니다; 그리고 Clopper-Pearson 절차는 i.i.d. 배포 가정하에 200개의 질문으로 구성된 보정 세트를 유한 표본 위험 인증서(finite-sample risk certificate)로 변환합니다. 실증적으로, 22개의 모델-태스크 쌍 중 8개가 예측된 경계값의 1% 이내에서 온도 스케일링 불가능 하한선(temperature-scaling infeasibility floor)에 도달했습니다. Platt 스케일링(Platt scaling)은 ECE를 0.02까지 낮추지만, 20% 위험 예산(risk budget)에서의 인증된 자율성(certified autonomy)은 단 3개의 모델-태스크 쌍에만 부여되었으며, 10%에서는 단 하나도 부여되지 않았습니다. 또한 우리는 TruthfulQA의 객관식 형태에서 나타나는 답변 순서 아티팩트(answer-ordering artifact)를 식별하고 수정했습니다. 보정은 신뢰도 의미론(confidence semantics)을 부여하며, 인증된 유예는 소형 모델을 안전하게 사용할 수 있는 시점을 결정합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기