저렴한 판별기로 '스스로 괜찮은지' 판단하게 하기: 자신감이 낮은 건만 상위 모델로
요약
본 논문은 대규모 평가 파이프라인에서 모든 질문을 고비용의 상위 모델에 전달할 필요 없이, 저렴한 '판별기(Judge)'를 사용하여 스스로 판단하게 하는 방식을 제안합니다. 이 판별기는 자신감 점수(`q`)를 반환하여, 자신감이 높으면 자체적으로 채택하고 낮을 때만 고성능 모델에게 에스컬레이션하는 구조입니다.
핵심 포인트
- 저렴한 Judge(JEV)가 GPT-6 대비 비용 효율성이 매우 높음 (약 277배 저렴).
- Judge는 긴 이유문 대신 판정과 레이블 확률만 반환하여 비용 절감에 기여함.
- 자신감 점수(`q`)를 임계값($ au$)과 비교하여 고성능 모델 사용 여부를 결정하는 것이 핵심 구조임.
- JEV의 성능은 작업 종류(예: 문장 기반 판정)에 따라 강점이 다르게 나타남.
예를 들어, 사내 평가 파이프라인이 있습니다. 채팅의 품질, 안전성, 답변이 근거와 일치하는지를 매일 종합적으로 판정합니다. 건수가 100만에 달하면 질문은 다음과 같습니다. 이 모든 것을 가장 높은 추론 모델에 전달할 필요가 있는가?
이 질문을 비용, 정확도, 대기 시간으로 측정한 것이 Carnegie Mellon University의 Li 등이 발표한 논문 JEV-as-a-Judge: Accept When Confident, Escalate When Unsure(2026년 9월 26일)입니다. 이유문을 생성하지 않는 판별기가 자신감을 반환하고, 높을 때만 채택하며 낮을 때만 상위 모델로 보냅니다. 논문 자체는 새로운 알고리즘의 제안이 아니라 그 측정이라고 언급합니다.
논문의 타이밍 패널에서는 측정 시점의 조건에서 GPT-6 Astra가 1,000 판정당 약 12.18달러, 중앙값 레이턴시(latency)는 약 1.89초였습니다. 비교 대상인 JEV 1.13 (TypeSafe의 판별 서비스)은 약 0.044달러, 중앙값 0.15초였습니다. 이는 약 277배 저렴하고, 중앙값 기준으로도 약 13배 빠르다는 수치입니다. 100만 판정으로 환산하면, 높은 쪽은 논문 서문에 나와 있듯이, 평가 한 번당 약 12,000달러가 발생합니다.
높은 모델을 어려운 곳에 배치하는 방식에서 남는 것은 '배치 설계'입니다. AI 버블 이후 IT 기술자들이 주목할 작은 AI(Small AI)에서도 다루었습니다. 본고에서는 그 틀을 판별 작업의 공개 벤치마크에서 본 수치로 한정하여 정리합니다.
이 저렴함은 JEV가 GPT-6만큼 똑똑하다는 의미는 아닙니다. 실험에서는 생성 모델 측도 긴 이유문 대신 판별과 레이블 확률만 반환하는 계약으로 응답했으며, 비용 차이는 그 계약에 맞춘 후에도 남아 있습니다. 무엇을 반환하는지는 다음에서 보겠습니다.
앞 절의 비용은 이 입출력을 전제로 합니다. JEV가 받는 것은 자연어 판정 조건과 구조화된 입력입니다. 그리고 반환하는 것은 지정한 형태의 판정과 각 레이블의 확률입니다. 긴 답변이나 왜 그렇게 판단했는지에 대한 문장은 내지 않습니다. 논문에서는 이러한 형태를 decision-only judge라고 부릅니다.
예를 들어, 두 개의 답변 중 어느 것이 더 좋은지 선택하게 한다고 가정하면, 반환되는 것은 다음과 같은 값입니다.
입력: 평가 규칙, 답변A, 답변B
↓
JEV
...
여기서 0.91이 게이트에 사용되는 자신감 q입니다. 논문에서는 각 레이블 확률의 최댓값입니다.
q = max_k p_k
JEV는 레이블 분포로부터 계산된 고유한 confidence도 반환합니다. RewardBench, JudgeBench, HaluEval에서는 이 값과 최대 확률 간의 순위 상관관계가 0.976, 0.999, 0.958이었습니다. 다른 모델과 같은 정의로 비교하기 위해 연구에서는 이 최댓 확률을 모든 judge의 q로 사용합니다.
이 q가 임계값 $ au$ 이상이면 JEV의 판정을 채택하고, 미만이면 고성능 추론 모델에게 보냅니다. 논문의 Figure 2가 이 구조이며, $ au$는 대상 워크로드에 따라 결정됩니다.
우리가 보는 것은 판별기를 포함한 이 파이프라인입니다. 저렴하게 끝날지는 다음 두 가지에 달려 있습니다. JEV가 어떤 작업에서 강한지. 자신감이 예외적인 케이스를 알려주는지입니다.
전체 순위만 보면, JEV는 중간 정도입니다. 공개된 4,850개의 판정을 15개 LLM judge로 종합했을 때 8위에 위치하며, GPT-6보다 1.7포인트, GPT-5.6 Sol보다 2.8포인트 낮습니다. 점수 차이가 나는 방식은 작업의 종류에 따라 상당히 다릅니다. 논문에서는 이를 문장으로부터 판정을 읽어낼 수 있는지, 답을 도출하지 않으면 판정할 수 없는지라는 경계로 보고 있습니다.
채팅 품질, 유해한 요청 거부, 답변해야 할 요청을 거부하지 않는 것, 근거 문서에 비추어 사실성. 이처럼 '읽으면 결정되는' 판정에서는 JEV가 GPT-6와 약 2포인트 이내입니다. RewardBench 전체에서는 양자 모두 92.5%였습니다. 근거를 바탕으로 하는 HaluEval에서는 JEV 87.3%, GPT-6 88.4%입니다.
전문 지식, 코드, 수학, 논리 퍼즐에서는 격차가 벌어집니다. 논리 퍼즐은 JEV가 68.4%인 반면 GPT-6는 95.9%였습니다. JudgeBench에서는 JEV 78.6%, GPT-6 93.1%입니다. 다퉜던 항목을 레이블을 보지 않고 사람이 재검토했을 때, 69건 중 57건에서 GPT-6 측이 우세했고, JEV 측은 1건에 그쳤습니다. 사람이 재검토해도 차이는 남아있습니다.
분류, 대조(照合), 규칙에 따른 판정은 JEV가 비교적 강합니다. 계산, 탐색, 코드 추적, 다단계 추론은 추론 모델이 강합니다. 어려운 작업이 있다는 것 자체가 그 약점을 자신감이 알려준다면 1차 판정에 사용될 수 있습니다.
앞 절의 약점은 예외적인 상황에서 q
값이 낮아지는 경우입니다. 저렴한 모델이 어느 정도 틀리는 것 자체는 건수 설계로 흡수될 수 있습니다. 곤란한 것은, 틀리고 있는데 자신감이 높은 때입니다. 맞을 때는 q가 높고, 틀릴 것 같을 때는 q가 낮은 것입니다. 그러한 성질이 있다면, 일차 판정기로 사용할 수 있습니다.
JEV에서는 자신감이 높아짐에 따라 정확도도 대체로 올라갔습니다. 3가지 공개 태스크를 종합하면, q < 0.6의 214건에서는 55.1%였고, q = 1의 2,332건에서는 97.8%였습니다. q ≥ 0.9로 채택하는 범위에서는 JEV와 GPT-6가 거의 비슷합니다(각각 94.7%, 94.4%). 전송하는 쪽의 1,106건에서는 GPT-6가 7포인트 앞섭니다. GPT-6의 우위는 JEV가 망설이는 곳에 집중되어 있습니다.
여기서 확인하고 있는 것은, 자신감이 오류를 발견하는 신호가 되는지 여부입니다. 확신도가 낮은 예측을 기권하는 selective classification과 같은 생각이며, 논문도 그 계보를 참조했습니다. 이 신호가 있기 때문에, 다음과 같이 채택과 대체로 나눌 수 있습니다.
q가 τ를 밑도는 입력은, 강력한 judge가 다시 판정하고, 그 결과를 최종 결과로 합니다. JEV의 답변을 수정하게 하는 형태는 아닙니다. 오프라인 수치는 별도로 모은 출력을 조합한 시뮬레이션입니다. 같은 방침을 실제로 호출할 때도, 게이트가 보낸 경우에만 GPT-6를 호출합니다.
선행 모델의 답을 상위 모델에게 보여주면, 이전에 본 판정에 치우칠 가능성이 있습니다. 이 논문이 그 편향을 측정한 것은 아니므로, 구현에서는 '보여주지 않기'를 기본으로 하는 것이 안전합니다.
다음 함수는 Figure 2의 게이트를 코드 형태로 만든 것입니다. JEV API는 호출하지 않고, 임계값 위치만 확인하는 스케치입니다. τ에는 자체 라벨로 미리 정한 값을 전달합니다.
def cascade(jev_probabilities: dict[str, float], tau: float, fallback):
""q가 tau 이상이면 JEV를 채택하고, 미만이면 fallback의 판정으로 대체한다.
fallback에는 JEV의 확률도 판정도 전달하지 않는다.
...
돌아가게 하려면 Python 3로 충분합니다. fallback은 상위 모델을 한 번 호출하는 함수라고 가정합니다. 교정, 요금 계산, 양쪽 순서의 평균은 포함되어 있지 않습니다.
이 두 단계가 다루는 것은, 답변의 좋고 나쁨에 대한 판정입니다. 코드가 테스트를 통과하는지, 조작이 권한 내인지 여부는 스키마나 테스트에서 별도로 봅니다. 그 이야기는 'LLM에게 맡기기'가 위험한 이유—수학이 보여주는 한계와, 설계로 보완할 3가지 원칙에 쓰여 있습니다. 여기부터는, 판정 자체를 두 단계로 했을 때, 임계값을 먼저 고정하면 어떤 일이 일어났는지입니다.
임계값은 평가 결과를 보고서 편리하게 움직인 것이 아닙니다. 파일럿 중, 임계값 전용의 96건에서, 상위 모델과의 차이를 2포인트 이내로 유지하면서 JEV로 처리할 수 있는 비율이 최대가 되는 τ를 선택하고, 그 후 미사용 데이터로 평가했습니다. 고정된 방침의 τ는 0.9였습니다. 쌍은 양쪽 순서로 판정한 후, 맞춘 확률을 평균해서 게이트합니다.
미사용의 1,610건에서는, 약 31%를 상위 모델에게 보냈습니다. 정확도는 GPT-6 단독의 92.5% 대비 93.4%로, 0.9포인트 높았습니다. 구간은 대략 0.2에서 1.7포인트이므로, 추가 증가는 작습니다. 낮아진 것은 비용으로, GPT-6 단독의 약 41%까지입니다. 부족한 이용량을 높게 추정하면, 약 44%입니다.
무엇이 JEV에 남고, 무엇이 상위 모델로 갔는지는, 워크로드로 나누어 볼 수 있습니다.
| 조건 | 상위로 보낸 비율 | 정확도 | 비용 (GPT-6 단독 대비) |
|---|---|---|---|
| RewardBench (1,340건) | 약 25% | GPT-6보다 약 1.3포인트 높음 | 약 27% |
| ... | |||
| RewardBench는 쉬운 편입니다. 약 25%만 보내고, 정확도는 GPT-6보다 약 1.3포인트 높아졌습니다. 양쪽의 오류가 다른 건에 분산되었고, JEV의 오류가 낮은 자신감 쪽으로 몰렸기 때문입니다. JudgeBench는 어려운 편입니다. 약 65%를 보내도 92.2%까지로, GPT-6의 93.0%에는 미치지 못합니다. 차이의 94%는 메워지지만, 비용 절감은 약 33%입니다. 어려운 판정에서는 먼저 정확도를 지키는 것이 중요합니다. |
어려운 판정에서도 정확도를 떨어뜨리지 않을지, 절차를 정한 후 측정한 것이 새로운 워크로드에서의 실측입니다. 대상은 JEV가 취약한 '정확성 판정'입니다. PPE의 500건과 그동안 판정하지 않았던 JudgeBench의 Claude 측 270건에서 각각 100건으로 임계값을 정하고, 나머지 570건으로 측정했습니다. 선택된 τ는 0.95와 0.99로, 이전에 동결했던 0.9와는 다른 값입니다.
여기서는 JEV 단독이 GPT-6보다 약 14포인트 낮은 상태에서 시작합니다(76.1% 대 90.2%). 캐스케이드 방식은 68%와 89%로, 합쳐서 약 74%를 상위 단계로 보내 양쪽 모두 GPT-6와 같은 정확도를 달성했습니다. 비용은 그럼에도 불구하고 약 25% 절감되었습니다.
이 570건이 보여주는 것은 '위험한 건을 상위 단계로 보낼 수 있는가'입니다.
쉬운 작업은 JEV에서 끝내고, 어려운 작업은 상위 단계로 보내는 이 분배 방식은 IT 분야에서는 익숙합니다.
지금까지도 L1 캐시의 뒤에 L2와 메모리를 두고, CDN의 뒤에 오리진을 두고, 1차 지원의 뒤에 전문 담당자를 두고, 규칙 엔진의 뒤에 사람 검토를 두었습니다. 저렴한 처리를 앞에 배치하고, 어려운 것만 높은 처리 단계로 보내는 순서입니다. JEV의 캐스케이드 방식도 이 순서를 따릅니다.
평소의 분기 기준이 파일 크기 > 10MB라면, 여기에서의 분기는 q < τ입니다. 작업의 어려움을 모델이 제시한 불확실성으로부터 추정하여 분배하고 있습니다.
경로를 질문의 길이만으로 결정하지 않는다는 시각은 Claude Opus 5에서 읽을 수 있으며, 생성 AI 경쟁의 다음 단계는 '성능 경쟁'에서 '비용·신뢰성·운영 설계'로 이동하고 있다고도 서술합니다. 이번 자료는 판별기 자체의 자신감에 관한 것입니다. 같은 벤치마크 안에서도 글의 길이보다 그 글에서 무엇을 해야 하는지가 차이에 영향을 미쳤습니다.
지금까지 q를 게이트의 열쇠로 사용해 왔습니다. 구현 과정에서 오해하기 쉬운 부분은 그 읽는 방식입니다. JEV가 A = 0.91이라고 반환하더라도, A가 91% 확률로 맞다는 의미로 해석해서는 안 됩니다.
형식적인 확률을 반환하는 것과, 그 확률이 발생 빈도와 일치하는 것은 별개입니다. 논문에서는 이 구분을 명시하며 정확도뿐만 아니라 Brier score, NLL, ECE, 오류 탐지 AUROC 등도 측정하고 있습니다.
AUROC는 자신감의 낮음이 오류를 상위 단계로 보낼 수 있는지에 대한 지표입니다. JEV의 1회 판정에서는 RewardBench 0.875, JudgeBench 0.745, HaluEval 0.827을 기록했습니다. JudgeBench에서는 GPT-6이 오류를 더 잘 보내줍니다. HaluEval에서는 사람이 레이블을 수정할 경우 확률 점수의 우열이 역전된다는 민감도 분석도 있습니다. 공개된 레이블 그대로의 수치는 '교정 완료'로 취급하지 않는 것이 안전합니다.
발생 빈도가 워크로드에 따라 달라진다면, τ 역시 하나의 상수만으로는 부족합니다. 논문의 Figure 2에도 τ는 로컬 레이블로 선택해야 한다고 나와 있습니다. 확인하기 전에 τ를 코드에 임베드하는 것은 안전하지 않습니다.
0.70으로 조정하면 JEV의 채택이 늘어나 비용은 저렴해지지만, 오판은 증가하기 쉽습니다. 0.95로 조정하면 상위 단계로 많이 흐르므로 비용은 올라가고, 오판은 줄어들기 쉽습니다. 이는 비용과 위험의 교환입니다.
점 추정으로 '2포인트 이내면 좋다'고 선택했을 때, 논문의 재추첨에서는 2포인트를 초과하여 떨어뜨리는 방침이 약 40%에서 50%의 시도에서 나왔습니다. 정확도 차이의 하한 95%가 마이너스 2포인트를 넘지 않는 조건으로 바꾸자, 그 비율은 약 100건에서 약 5%까지 떨어집니다. 워크로드별로 τ를 분리하면 96건에서 0.6%였습니다. 같은 데이터의 재추첨이므로 분포가 바뀔 때의 낙관론은 남아있습니다. 그럼에도 불구하고 'τ=0.9로 유지'하는 것보다 이 하한값이 판단 자료가 됩니다.
τ를 신중하게 정하더라도, 자신감이 오판 여부와 관계없는 작업에서는 게이트가 작동하지 않습니다. 논문에는 그 조건이 두 가지 있습니다.
내용이 나빠도 길고, 자세하고, 그럴듯하게 작성된 답변으로 기울어지는 경우가 있습니다. RM-Bench에서 문체가 통일되었을 때 JEV는 85.4%였습니다. 잘못된 답변이 더 자세히 쓰여진 조건에서는 76.6%까지 떨어집니다. GPT-6은 91.8%에서 90.1%로, 움직임이 작습니다. 이 조건에서는 차이가 13.5포인트까지 벌어집니다. q ≥ 0.9의 오류율도 쉬운 쌍의 1.5%에서 이 어려운 쌍에서는 7.9%로 올라갔습니다. 문체 유도는 높은 자신감을 유지하는 경우가 있습니다.
근거가 있는 경우와 없는 경우에 따라 결과가 다릅니다. 근거 문서가 있는 요약에서는 JEV, GPT-4.1 mini, GPT-5.4의 레이블 일치율이 약 70%였습니다. 근거가 없는 자연문에서는 각각 53.5%, 54.0%, 56.0%로, 모두 우연에 가깝습니다. 그런데 평균 최대 확률은 JEV 0.91, GPT-4.1 mini 0.94, GPT-5.4 0.96입니다. JEV의 오류 감지 AUROC는 0.498로, 자신감의 높고 낮음이 맞고 틀림을 구분하지 못합니다.
모르면서 자신감이 있다. 이 조건에서는 confidence routing 자체가 작동하지 않습니다. 논문은 시도한 judge들 모두 근거가 없는 자연문에는 사용할 수 없다고 합니다. 자동 판정을 내리기 전에, 근거가 있는지를 보는 이유가 여기에 있습니다.
지금까지의 흐름은 모든 건을 최적 모델에 전달하는 방식에서, 쉬운 판정과 어려운 판정을 나누는 방식으로 이동한 것입니다. 이 논문에서 효과적인 것은, 싸게 판정하는 것, 자신감을 내는 것, 위험한 판정을 식별하는 것, 그리고 그 부분만 고성능 모델에게 보내는 것입니다. 높은 처리를 모든 요청에 균등하게 두지 않고, fast path와 slow path를 나누는 원칙이 LLM의 판정에서도 수치로 나타났습니다.
시도할 때는 자사의 판정을 먼저 두 가지로 나눕니다. 문장과 규칙을 대조하면 끝나는 일에는 이 경로를 적용합니다. 계산이나 코드 추적이 필요한 일은 처음부터 상위 모델에 배치합니다. τ는 100건 정도의 레이블로 하한을 보고, 동일 워크로드 중 미사용분으로 확인합니다. 문체 때문에 우열이 뒤집히는 평가와 근거가 없는 문장의 채점에는 이 게이트를 사용하지 않습니다.
그 위에 남는 질문은, 어떤 일에 어느 정도의 지능을 할당할 것인가입니다.
작성일: 2026-09-30
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기