모델 선택에 필요한 레이블 개수는 얼마나 될까? 선택적 예측을 위한 인증서와 예산
요약
본 연구는 분류기들의 선택적 성능을 비교하기 위해 필요한 최소한의 레이블 개수(인증서 크기)를 정량화했습니다. 일반화된 위험-커버리지 곡선 아래 면적(AUGRC)과 같은 특정 지표를 고려할 때, 정확한 모델 비교를 위해서는 전체 레이블 중 상당한 비율의 데이터가 필요함을 보여줍니다.
핵심 포인트
- 모델 선택을 위한 최소 레이블 개수를 정량화함.
- AUGRC 기반 비교 시 필요한 레이블 양이 다름.
- 정확한 획득 정책은 거의 모든 레이블을 요구하지만, 특정 조건에서는 절반만으로 충분할 수 있음.
분류기(Classifiers)들은 동일한 예측을 내릴 수 있지만, 그들의 선택적 성능을 비교하기 위해서는 레이블이 필요합니다. 신뢰도 순위(confidence ranks)는 같은 오류들을 다르게 가중합니다. 우리는 일반화된 위험-커버리지 곡선 아래 면적(AUGRC)에 대한 이러한 요구 사항을 정량화합니다. 사전 레이블 하한(prelabel lower bound)은 불충분한 예산을 배제합니다. 모든 레이블이 알려진 경우, 커버링 선형 계획법(covering linear program)은 $K$개의 후보군에 대해 승자(the winner)를 확정하는 데 충분한 최소 레이블 개수(인증서 크기, certificate size)를 $K-1$개 레이블 내에서 경계 지을 수 있습니다. 고정된 $K$, 독립적인 균일 순서(independent uniform orders), 그리고 동일한 예측의 경우, 사전 레이블 하한은 풀(pool)의 4분의 1에 접근합니다. 순서와 독립적이며 iid 베르누이 오류(iid Bernoulli errors)가 있는 경우, 모든 정확한 획득 정책(exact acquisition policy)은 점근적으로 거의 모든 레이블을 읽지만, 두 후보군 인증서만으로는 절반만 필요합니다. 아홉 개의 데이터셋에서 수행된 108개의 특징-패널 비교를 통해, 불일치 레이블(disagreement labels)은 모든 정확도 선택지에서 정착하지만 AUGRC 선택지에서는 그렇지 않습니다. 96개 조건에서 20%의 예산이 배제되었으며; 인증서는 평균적으로 5657%가 필요합니다. 사전 학습된 이미지 분류기(pretrained image classifiers)를 사용한 10개 조건에서, 정확한 선택을 위해서는 10,000개의 레이블 중 6891%의 신뢰도 점수 선택이, AUGRC 허용 오차 $5 imes10^{-4}$와 함께는 50~67%가 필요합니다. 정확한 정지 테스트(exact stopping test)는 모든 획득 순서로 작동합니다. 종합적으로, 이러한 결과들은 신뢰도 순위와 레이블 예산 및 인증된 모델 비교를 연결합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG (Machine Learning)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기