
판사가 내 헤드라인에 0.00점을 주었다. 문제는 비교 대상이었다.
요약
LLM 판사(LLM Judge)를 활용한 평가 시스템에서 비교 대상(Comparison Set) 설정의 중요성을 다룹니다. 부적절한 비교군은 모델 점수를 왜곡하며, 점수는 절대적 가치가 아닌 상대적 위치를 나타낼 뿐임을 강조합니다.
핵심 포인트
- LLM 점수는 비교 대상(Candidate set)에 따라 결과가 완전히 달라짐
- 단일 점수만으로 품질을 판단하는 것은 위험하며 측정 설정 확인이 필수적임
- FairEval과 IF-RewardBench 사례를 통해 LLM 판사와 인간 간의 격차 존재 확인
- 모델 기반 점수를 최적화 루프에 사용할 때 상대적 점수의 맥락을 고려해야 함
판사가 내 헤드라인에 0.00점을 주었다. 문제는 비교 대상이었다.
[0] 판결 (Verdict)
- 점수는 글에 대한 판결이 아닙니다. 그것은 측정 설정(measurement setup), 즉 후보(candidate), 비교 세트(comparison set), 판사(judge), 순서(order), 그리고 검증 분할(validation split)의 결과물입니다.
- 내가 작성한 헤드라인 중 하나가 0.00점을 받았습니다. 비교 대상을 확인해보니, 합의 뉴스(settlement news)와 제품 출시(product launch) 소식이 있었습니다. 뉴스 헤드라인이 에세이 헤드라인과 비교되고 있었던 것입니다.
- FairEval은 응답 순서가 LLM 순위(rankings)를 왜곡할 수 있음을 보여주었습니다. IF-RewardBench는 2026년에도 여전히 판사 모델(judge models)과 인간의 순위 성능(human ranking performance) 사이에 큰 격차가 있음을 발견했습니다.
- 이 글은 최적화 루프(optimization loop) 내에서 모델 기반 점수(model-based scores)를 사용하는 사람들을 위한 것입니다. 품질이 무엇인지 결정하기 위해 단 하나의 숫자를 원하는 사람들을 위한 것이 아닙니다.
[1] 0.00 점수
나는 평가자(evaluator)에게 헤드라인 후보 세트를 전달했고, 내 것이 0.00점을 받는 것을 지켜보았습니다.
나의 첫 반응은 단순했습니다. '헤드라인이 나쁜 게 틀림없다'는 것이었습니다. 그러다 그것이 무엇과 비교되었는지 후보군을 열어보았습니다. 그 세트에는 합의 뉴스 헤드라인과 제품 발표 내용이 포함되어 있었습니다.
그 결과는 쓸모없는 것이 아니었습니다. 만약 독자가 그날의 뉴스를 찾고 있다면, 뉴스 헤드라인이 에세이 헤드라인을 이기는 것이 당연합니다. 하지만 내 에세이가 강력한 관점(angle)을 가졌는지에 대한 판단으로서는 쓸모가 없었습니다. 비교 과정에서 두 가지 서로 다른 작업이 섞여 있었던 것입니다.
그 숫자는 해당 비교 내에서 내 헤드라인이 어디에 위치하는지를 알려주었을 뿐입니다. 세상에서의 헤드라인 가치를 알려준 것이 아니었습니다.
이러한 구분은 매우 중요합니다. 왜냐하면 모델 점수(model score)는 종종 다음 단계로 그대로 복사되기 때문입니다. 승자를 유지하거나, 프롬프트(prompt)를 수정하거나, 기술(skill)을 업데이트하거나, 에이전트(agent)에게 비용을 지불하는 식입니다. 상대적 점수(relative score)는 그것이 무엇에 대한 상대적인 것인지 묻기도 전에 보상 신호(reward signal)가 되어버립니다.
[2] 판사 점수가 측정하는 것
LLM 판사(LLM judge)는 다른 모델의 출력을 채점하거나 순위를 매기도록 요청받은 모델입니다. 이는 점수(point score), 쌍체 비교 승자(pairwise winner), 또는 리스트 단위 순위(listwise ranking)를 생성할 수 있습니다.
판사는 반복 가능한 첫 번째 패스(first pass)를 제공할 수 있을 뿐, 최종적인 정답을 제공하는 것은 아닙니다. 예를 들어, SkillOpt는 기술 문서를 외부 에이전트 상태(external agent state)로 취급하며, 홀드아웃 검증 점수(held-out validation score)가 엄격하게 개선될 때만 제한된 편집(bounded edits)을 허용합니다. 홀드아웃 세트(held-out set)는 편집 단계 외부로 유지되는 데이터입니다.
점수는 온도계의 측정값과 같지 않습니다. 점수는 최소한 다음 다섯 가지 요소에 따라 달라집니다:
| 점수 입력값 | 숫자 옆에 두어야 할 질문 |
|---|---|
| 후보군 (Candidate) | 우리가 실제로 측정하고 있는 것은 무엇인가: 진실성, 스타일, 길이, 아니면 예상 클릭수인가? |
| ... |
이러한 필드들이 없는 점수는 재현 가능한 영수증이 아닙니다.
[3] 측정이 실패하는 세 가지 방식
순서가 바뀌면 승자가 바뀐다
Wang과 동료들은 FairEval에서 응답 평가자(response evaluators)로서의 LLM 사용을 연구했습니다. 그들은 ChatGPT가 평가자였을 때, 테스트된 80개의 쿼리 중 66개에서 Vicuna-13B가 ChatGPT를 이긴 사례를 보고했습니다. 핵심은 Vicuna가 보편적으로 더 뛰어났다는 것이 아닙니다. 핵심은 응답의 순서를 바꾸는 것이 순위(ranking)를 왜곡할 수 있다는 점입니다.
해당 확인 작업에 대한 나의 메모에는 모델 버전, 전체 후보군, 또는 각 순서에 대한 점수가 보존되어 있지 않습니다. 나는 나중에 발견된 관찰 결과를 재현 가능한 측정값으로 제시하지 않을 것입니다. 신중한 설명만으로는 결정이 위치(position)로부터 독립적이었다는 것을 증명할 수 없습니다.
FairEval의 실질적인 대응은 구조적입니다: 여러 증거를 요구하고, 위치(positions) 전반에 걸쳐 집계하며, 어려운 사례는 사람에게 전달하는 것입니다. "공정하라"는 것은 지시 사항입니다. 균형 잡힌 위치 설정은 실험 설계(experiment design)입니다.
자기 수정(Self-correction)은 참조값 없이도 움직일 수 있다
Huang과 동료들은 모델이 외부 피드백 없이 스스로의 추론을 수정하려고 시도하는 내재적 자기 수정(intrinsic self-correction)을 조사했습니다. 그들의 논문에 따르면 모델은 스스로를 수정하는 데 자주 실패하며, 수정을 시도한 후에 오히려 성능이 더 나빠질 수 있다고 보고합니다.
동일한 경고가 쓰기 루프 (writing loops)에도 적용됩니다. 만약 동일한 판사 (judge)가 수정본이 더 낫다고 말한다면, 그 수정본은 독자를 위해 개선된 것이 아니라 판사의 선호도를 학습했을 가능성이 있습니다. 별도의 정답지 (answer key), 엄격한 검증 (hard check), 다른 평가자 (evaluator), 또는 손대지 않은 예시 (untouched examples)를 제공해야 루프가 다른 기준점에 설 수 있습니다.
새로운 판사들이 깔끔한 탈출구는 아니다
IF-RewardBench는 지시 이행 (instruction following)을 평가하는 판사들을 위한 2026년 벤치마크 (benchmark)입니다. 여기에는 842개의 지시 사항, 6,011개의 응답, 그리고 9,145개의 선호 관계 (preference relations)가 포함되어 있습니다. 저자들은 단순히 하나의 승자를 고르는 것이 아니라, 여러 응답의 순위를 매기는 능력을 평가합니다.
보고된 격차는 큽니다. 인간의 제약 조건 평가 (constraint-assessment) 순위는 0.755의 켄달 상관계수 (Kendall correlation)에 도달합니다. 보고된 표에서 가장 뛰어난 독점 모델 (proprietary model)인 Gemini-3-Pro는 0.609에 도달합니다. 저자들은 다회차 문맥 (multi-turn context), 시스템 프롬프트 (system prompts), 주관적인 스타일 제약 (subjective style constraints), 그리고 더 복잡한 지시 사항들이 판정(judging)을 더 어렵게 만든다고 보고합니다.
더 나은 모델들이 도움이 되기는 합니다. 하지만 모델이 벤치마크 점수를 높인다고 해서, 그것이 모든 독자에 대한 사실이 되는 것은 아닙니다.
[4] 보상 오염 (reward contamination)이 시작되는 곳
여기서 보상 (reward)이란 최적화 루프 (optimization loop)에 어떤 후보를 유지할지 알려주는 숫자를 의미합니다. 오염 (contamination)에는 악의적인 모델이 필요하지 않습니다. 약간 잘못된 비교만으로도 충분합니다.
- 정확성 (correctness)을 원하지만, 판사가 길이에 보상을 주는 경우.
- 독자의 흥미 (reader interest)를 원하지만, 에세이 옆에 속보 헤드라인을 두는 경우.
- 독립적인 검증 (independent check)을 원하지만, 편집을 형성했던 예시들을 재사용하는 경우.
- 콘텐츠 품질 (content quality)을 원하지만, 후보들의 위치를 절대 바꾸지 않는 경우.
그러면 루프는 원래의 목적에서 벗어나면서 눈에 보이는 점수만을 개선하게 됩니다. 루프는 판사가 무엇을 좋은 답변으로 인식하는지를 학습합니다. 그것은 가치 있는 일일 수 있지만, "독자가 더 많은 가치를 얻었다"는 주장과는 동일하지 않습니다.
SkillOpt는 유용한 부분을 명시적으로 만듭니다: 편집 범위를 제한하고, 홀드아웃 점수(held-out score)를 개선하지 않는 변경 사항은 거부하며, 검증 경계(validation boundary)를 유지합니다. 자체 문서에서도 홀드아웃 게이트(held-out gate)가 측정된 작업에서의 회귀(regressions)를 줄여준다고 명시하고 있습니다. 이는 보안 경계(security boundary)나 일반적인 개선의 증거가 아닙니다.
그 문장은 인상적인 성능 향상보다 더 중요합니다. 게이트는 테스트 주변에 쳐진 울타리이지, 현실 주변에 쳐진 울타리가 아닙니다.
[5] 다음에 내가 저장할 것
0.00이라는 결과가 나온 후, 나는 점수를 완전한 결과물로 취급하는 것을 그만두었습니다. 다음 기록에는 숫자 옆에 다음 항목들을 함께 유지해야 합니다:
| 결과물 (Artifact) | 중요한 이유 |
|---|---|
| 비교 ID 및 캡처 시간 | 후보군을 실제로 이긴 것이 무엇인지 확인할 수 있게 해줌 |
| ... |
운영 순서는 간단합니다. 유사한 것끼리 둡니다. 위치를 바꿉니다. 기계적인 사실은 코드로 확인합니다. 실제 의미론적 비교(semantic comparison)가 필요한 부분에만 판사(judge)를 사용합니다. 그런 다음, 편집에 전혀 영향을 주지 않은 예시들로 편집 사항을 테스트합니다.
만약 결과가 뒤집혔을 때 서로 일치하지 않는다면, 나는 해당 비교가 불안정하다고 보고할 것입니다. 숫자를 평균 내어 더 차분해 보이는 점수로 만듦으로써 그 불일치를 숨기지 않을 것입니다.
[6] 점수는 여전히 유용한가?
네, 다음 실험을 선택하기 위한 신호(signals)로서는 그렇습니다. 아니요, 우리가 측정하려고 의도했던 대상의 대체재로서는 아닙니다.
| 용도 | 나의 판단 |
|---|---|
| 동일한 종류의 많은 후보를 필터링할 때 | 고정된 비교 세트와 위치 교환을 사용한다면 유용함 |
| ... |
나의 규칙은 "판사를 절대 사용하지 마라"가 아닙니다. "판사의 숫자를 그것을 만들어낸 비교 설계(comparison design) 외부로 가지고 나가지 마라"입니다.
[7] 내가 앞으로 가져갈 것
0.00은 내 헤드라인에 대한 최종 판결이 아니었습니다. 그것은 숨겨진 비교의 결과였습니다: 서로 다른 종류의 헤드라인, 하나의 평가자, 하나의 제시 방식, 그리고 눈에 보이는 참조 클래스(reference class)의 부재 말입니다.
만약 당신이 AI 개선 루프 (AI improvement loop)를 구축하고 있다면, 보상 (reward)을 높이기 전에 비교 대상을 저장하십시오. 상대방, 순서, 판사, 그리고 검증 분할 (validation split)을 숫자 옆에 나란히 두십시오. 이 작은 행동이 프록시 (proxy)를 최적화하고 그 프록시를 목표라고 부르는 일을 더 어렵게 만들어 줄 것입니다.
[8] Anicca와 계속하기
관련 페이지는 aniccaai.com에서 확인할 수 있습니다.
주석 (Notes)
Kendall 상관계수 (Kendall correlation)
Kendall 상관계수는 두 순위가 동일한 항목들을 얼마나 유사하게 정렬하는지를 측정합니다. 1에 가까운 값은 더 강력한 일치성을 의미합니다. 이 글은 보고된 IF-RewardBench 값을 그대로 사용하며, 이를 다른 지표로 변환하지 않습니다.
80개 중 66개의 예시
이것이 Vicuna가 모든 쿼리에서 승리했다는 의미는 아닙니다. 이는 ChatGPT를 평가자로 사용했을 때 Vicuna-13B가 테스트된 80개의 쿼리 중 66개에서 ChatGPT를 이길 수 있다는 FairEval 초록의 예시입니다. 저는 이것을 2023년의 결과를 모든 현재의 판사에게 일반화하기 위해서가 아니라, 순서가 어떻게 순위를 왜곡할 수 있는지를 보여주기 위해 사용했습니다.
출처 (Sources)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기

