모델은 쓰고, 판사는 측정한다: LLM Judge의 해부학
요약
LLM의 유창함이 진실성을 해치는 문제를 해결하기 위해, 생성된 주장을 증거와 대조하여 검증하는 독립적인 'LLM Judge' 구축 방법을 다룹니다. 다이아몬드 감정 사례를 통해 모델의 환각을 방지하고 품질을 수치화하는 프로세스를 설명합니다.
핵심 포인트
- LLM의 유창함(Fluency)과 진실함(Truth)은 별개의 변수임
- 생성된 모든 주장을 증거와 대조하는 독립적인 LLM Judge 도입
- 결정론적 코어와 언어 모델의 역할을 분리하여 품질 관리
- 고관여 제품군에서의 AI 신뢰성 확보를 위한 검증 메커니즘
팀의 밤잠을 설치게 만들 법한 문장은 다음과 같습니다:
"이 투명도 등급(clarity grade)에서는 육안으로 아무것도 볼 수 없을 것입니다."
우리 어시스턴트가 다이아몬드를 설명하는 과정에서 이 문장을 생성했습니다. 모델이 인용한 등급은 실제 데이터입니다. 해당 원석의 감정서에 SI1이라고 인쇄되어 있었기 때문입니다. 하지만 그에 따라 붙은 약속(결과)은 지어낸 것입니다. 투명도 등급은 10배 확대경(10× magnification) 하에서 부여되는 것이지, 육안으로 무엇이 보일지를 결정하는 것이 아닙니다. 두 개의 SI1 원석은 완전히 다르게 보일 수 있습니다. 하나는 팔을 뻗은 거리에서도 깨끗해 보일 수 있지만, 다른 하나는 정중앙에 눈에 띄는 점이 있을 수 있습니다. 모델은 사실을 가져와 그에 따른 결과를 조작했습니다. 왜냐하면 그렇게 하는 것이 '도움이 되는 문장'처럼 들리기 때문입니다.
이 문장이 무엇이 아닌지에 주목하십시오. 금지된 단어를 사용한 것이 아닙니다. 존재하지 않는 원석을 환각(hallucination)한 것도 아닙니다. 틀린 숫자를 포함하고 있지도 않습니다. 사전에 작성할 수 있는 어떤 규칙도 어기지 않았습니다. 단지 유창할 뿐입니다. 그리고 그 유창함이 바로 문제입니다. 유창함(fluency)과 진실함(truth)은 서로 다른 변수이며, 언어 모델(language model)은 첫 번째 변수를 최적화합니다.
우리는 바로 이런 종류의 제품을 위한 AI 어시스턴트를 구축합니다. 이 에세이에서 다루는 모델은 다이아몬드를 설명합니다. 해당 원석의 증거 자료로부터 생성된, 두 명의 화자가 참여하는 짧은 대화입니다. 진행자가 구매자가 물어볼 법한 질문을 던지면, 보석학자가 답변하는 방식입니다. 다이아몬드는 고관여 구매(high-consideration purchase)의 정의와도 같습니다. 수천 달러에 달하며, 드물게 구매되고, 불확실성 속에서 선택됩니다. 또한 생성형 AI(generative AI)에게 있어 매우 가혹한 테스트 베드가 될 수밖에 없는 속성을 가지고 있습니다. 다이아몬드에 관한 거의 모든 주장은 세계 다이아몬드 등급을 매기는 독립 연구소인 GIA 또는 IGI의 감정서와 대조하여 확인할 수 있기 때문입니다. 여기서 과장 광고는 단순히 품격이 떨어지는 문제가 아니라, 검증 가능한 문제입니다.
이전 에세이에서 우리는 결정론적 코어(deterministic core)가 모든 결정을 내리는 동안 언어 모델은 대화를 주도해야 한다고 주장했습니다. 이 에세이는 동일한 세계관을 품질(quality)에 적용한 것입니다. 모델은 글을 씁니다. 하지만 모델이 등급을 매기게 해서는 안 됩니다.
한 문장 정도는 읽으면서 위와 같은 문장을 잡아낼 수 있습니다. 하지만 수많은 보석 목록을 훑어보는 과정에서는 불가능합니다. 그래서 우리는 작성자(writer)를 개선하기에 앞서 하나의 도구를 만들었습니다. 생성된 모든 주장(claim)을 증거와 대조하여 읽고, 우리가 수치화할 수 있는 판결을 내리는 독립적인 LLM 판사(LLM judge)입니다. 이 에세이는 그 판사가 어떻게 구축되는지, 판사 자체의 정직함을 어떻게 유지하는지, 그리고 판사를 갖게 된 후 무엇이 변했는지 — 즉, 논쟁이 멈추게 된 과정에 대해 다룹니다.
제1부 — 세 개의 관문, 그리고 규칙의 소유권
어시스턴트는 해당 다이아몬드의 증거, 즉 실험실 인증서, 가격, 소매업체가 발표한 보석 분석 자료를 바탕으로 한 번에 하나의 다이아몬드에 대해 설명합니다. 단 하나의 규칙이 모든 것을 지배합니다: 이 보석에 관한 모든 주장은 반드시 제공된 증거에 근거해야 한다. 만약 증거가 질문에 답할 수 없다면 — 예를 들어, 육안으로 보이는 결함이 없는 'eye-clean' 상태인가? — 어시스턴트는 이를 명시적으로 말합니다. 정직한 답변은 '아마도'이며, 그 이상의 약속은 하지 않습니다. 그런 다음 쇼핑객에게 전문 보석 감정사를 안내합니다.
이 규칙을 집행하는 것은 단 하나의 메커니즘이 아닙니다. 세 가지의 계층화된 메커니즘이며, 그 성격 또한 서로 다릅니다.
첫 번째 관문은 예방합니다. 이는 파이프라인(pipeline) 내부의 코드 상에서 실행됩니다. 어시스턴트가 보석에 대한 후속 질문을 생성할 때, 그 질문은 답변의 근거가 될 증거 경로(evidence path)를 반드시 명시해야 합니다. 사용 가능한 경로를 명시하지 않은 질문은 프롬프트(prompt)에 의한 기대가 아니라, 코드에 의해 거부됩니다. 이것이 바로 데이터에 비교 대상이 없는 보석에 대해
세 번째 관문이 판결합니다. 방지와 정규 표현식 (regex) 이후에 남는 것은 위험한 부류, 즉 '그럴듯하지만 근거가 없는 주장'입니다. "육안으로는 아무것도 보이지 않을 것입니다"라는 문장은 두 관문을 모두 통과합니다. 어떤 규칙도 이를 사전에 명시하지 않는데, 왜냐하면 이것은 단순한 문구가 아니라 문장과 실험 보고서 사이의 관계이기 때문입니다. 이를 확인하려면 두 가지를 모두 읽어야 합니다. 그것은 독자의 몫이며, 대규모 규모(scale)에서는 독자가 모델이어야 합니다.
여기서 한 가지 세부 사항은 우리가 예상했던 것보다 더 많은 것을 가르쳐 주었습니다. 관문 사이의 경계 자체가 하나의 설계 결정(design decision)이라는 점입니다. 도메인 전문가의 스타일 가이드에서 금지어 목록을 확장했을 때, 모호하지 않은 용어들은 정규 표현식 (regex) 관문으로 들어갔습니다. 하지만 문맥에 의존하는 용어들은 의도적으로 제외되었으며, 가장 좋은 예는 _flawless_입니다. 대부분의 제품에서 "flawless"는 빈말에 불과한 찬사입니다. 하지만 다이아몬드에서 이는 말 그대로 등급입니다: GIA 투명도 등급의 최상위인 FL입니다. "It is not flawless"는 찬사를 아끼는 것이 아니라, SI1 등급의 원석에 대한 사실적인 진술입니다. 마찬가지로 "guaranteed"의 경우도 그렇습니다. 실제 테스트 장치는 "그것은 보고서가 제공하지 않는 보증이 필요할 것입니다"라는 문장이 어시스턴트가 보여줄 수 있는 가장 정직한 모습임을 입증했습니다. 투박한 정규 표현식 (regex)은 정확히 저런 문장들에서 실패할 것입니다. 따라서 해당 단어들은 문자열(string)뿐만 아니라 의미(sense)를 읽을 수 있는 판사(judge)에게 전달되었습니다. 어떤 규칙이 어떤 관문에 속할지는 기본값이 아닙니다. 그것은 결정이며, 우리는 테스트 증거를 바탕으로 그 결정을 내렸습니다.
제2부 — 판결의 해부학
"LLM 판사(LLM judge)를 사용하라"는 말은 보통 다음과 같은 의미입니다: 모델에게 출력값에 대해 1점에서 10점 사이의 점수를 매기라고 요청하는 것입니다. 그러한 점수는 숫자가 붙은 하나의 의견일 뿐입니다. 그것에 대해 항소할 수도 없고, 감사(audit)할 수도 없으며, 7점이라는 점수가 두 개의 작은 문제 때문인지 아니면 하나의 큰 문제 때문인지 알 수 없습니다. 그것은 측정 도구가 아니라, 하나의 기분(mood)에 가깝습니다.
우리의 판사는 다르게 구축되었으며, 모든 차이점은 단순한 방식(naive version)이 먼저 실패했기 때문에 존재합니다.
점수가 아닌 분류(triage)를 반환합니다. 입력 데이터를 재진술하는 것 이상의 무언가를 주장하는 모든 문장에 대해, 판사는 유형화된 질문에 답합니다: 이것이 이 보석에 대한 주장인가, 아니면 일반적인 다이아몬드에 대한 주장인가? 만약 이 보석에 관한 것이라면 — 증거가 이를 입증하는가? 만약 일반적인 것이라면 — 정확한 보석학(gemology)인가? "실험실 성장 다이아몬드와 천연 다이아몬드는 화학적으로 동일하다"는 교육적 범주에 해당합니다: 이는 허용되며, 권장되는 사항입니다 — 판사의 지침(instructions)에 따르면 교육은 결코 위반이 아닙니다. "이 보석은 육안으로 보기에 하얗게 보일 것입니다"는 개별 항목에 대한 주장(item claim)이며, 반드시 무언가로 추적 가능해야 합니다. 실제 위반은 오직 이 둘의 교차점, 즉 이 보석에 관한 것이면서 동시에 근거가 없는 경우뿐입니다.
주장에는 또한 소유자가 있습니다. 근거 유무(Supported)만이 유일한 축은 아닙니다. GIA가 보석을 감정했고, 소매업체가 이를 분석했으며, 어시스턴트가 브랜드를 대변합니다. 만약 어시스턴트가 "저희는 이것을 VS1으로 감정합니다"라고 말한다면, 모든 단어는 사실적으로 참이지만 그 문장은 여전히 위반입니다 — 이는 실험실의 성과를 브랜드의 것으로 돌리기 때문입니다. 판사는 잘못된 귀속(misattribution)을 근거 없는 주장(unsupported claims)과는 별개의 클래스로 분류합니다. 출처(provenance) 오류는 신뢰할 수 있는 목소리가 자신이 갖지 못한 권위를 조용히 주장하는 방식이기 때문입니다.
판사는 자신이 승인한 주장들도 보고해야 합니다. 판사는 일반적인 진술과 근거가 있는 주장들도 분류가 보이도록 목록화해야 하며, 이들이 위반 횟수를 부풀리는 것은 금지됩니다. 이것은 관료주의처럼 들릴 수 있습니다. 하지만 이것이 핵심입니다. 문제점만 나열하는 판결은 당신이 믿어야만 하는 하나의 숫자일 뿐입니다. 모든 판결을 보여주는 판결 — 각 인용구를 그대로 보여주고, 각 인용구가 어떤 증거 경로를 통해 확인되었는지 명시하는 판결 — 은 당신이 재확인할 수 있는 감사 추적(audit trail)입니다. 판사가 틀렸을 때, 당신은 정확히 어느 지점에서 틀렸는지 확인할 수 있습니다.
직교 신호는 직교 상태를 유지합니다 (Orthogonal signals stay orthogonal). 판사는 어조(tone) 또한 측정합니다. 어시스턴트가 신뢰할 수 있는 전문가처럼 들리는지, 아니면 수수료를 챙기려는 영업사원처럼 들리는지를 확인합니다. 대화가 두 사람이 주고받는 대화처럼 들리는지, 아니면 대본처럼 들리는지를 봅니다. 하지만 어조는 별개의 하위 채널이며, 판사의 지침은 단호합니다. 즉, 따뜻한 말투가 근거 없는 주장을 정당화할 수는 없다는 것입니다. 포맷팅 체크(formatting check)는 세 번째 채널에서 작동하며, 정직성 점수에는 아무런 영향을 미치지 않습니다. 의도적으로 혼합 점수(blended score)를 사용하지 않습니다. 혼합 점수는 따뜻한 어조가 부정직함을 숨길 수 있는 지점이기 때문입니다.
작성자와 판사는 동일한 헌법을 읽습니다. 실험 보고서가 무엇을 지원하고 무엇을 지원하지 않는지에 대한 모든 규칙은 하나의 콘텐츠 표준 문서(content-standard document)에 담겨 있습니다. 이 문서는 작성자의 프롬프트(prompt)와 판사의 프롬프트에 모두 삽입됩니다. 사양(spec)은 단일한 산출물(artifact)입니다. 작성자는 이를 구현하고, 판사는 이를 집행하며, 문장 하나를 수정하면 계약의 양측이 동시에 변경됩니다. 판사만이 믿고 있는 규칙 버전이란 존재하지 않습니다.
판사는 자신의 출력물을 절대 채점하지 않습니다. 작성자들은 Claude Sonnet 5로 구동됩니다. 판사 자리에는 두 모델이 거쳐 갔습니다. 처음에는 완전히 다른 연구소의 GPT-5.5였고, 현재는 작성자와는 다른 모델인 Claude Opus 4.8이 맡고 있습니다. 우리는 모델 교체 과정에서도 이 규율이 유지됨을 확인했습니다. 자신의 글을 채점하도록 요청받은 모델은 가중치(weights) 자체에 이해 상충(conflict of interest)이 내재되어 있습니다. 독립성은 인위적으로 구축되어야 합니다.
판사는 프로덕션(production)에 절대 관여하지 않습니다. 판사는 개발 도구이지, 런타임 가드레일(runtime guardrail)이 아닙니다. 판사는 개발 사이클 동안 출력물을 채점하여 작성자의 프롬프트가 어디서 누수되는지 찾아냅니다. 이는 서비스 제공 시 지연 시간(latency)과 비용을 전혀 추가하지 않습니다. 다이아몬드 하나를 채점하는 데는 약 30센트가 소요됩니다. 이는 전체 증거를 다시 읽는 4번의 패스(pass)를 포함한 비용으로, 개발 단계에서는 사소할 정도로 저렴하지만, 결정론적 게이트(deterministic gates)가 이미 서 있는 프로덕션 환경에서는 무의미하게 비쌉니다. 판사는 콘텐츠 필터가 아닙니다. 판사는 무엇을 수정해야 할지 알아내는 방법입니다.
파트 III — 측정 도구의 보정(Calibrate the instrument)
불편한 사실은 이겁니다: 판사 역시 언어 모델입니다. 신뢰할 수 없는 서술자를 감사하기 위해 고용된, 신뢰할 수 없는 서술자 그 자체인 셈이죠. 이는 들리는 것보다 덜 터무니없습니다 — 감사관들 역시 사람이니까요 — 하지만 워크플로우가 이를 계획해야만 합니다. 저희는 세 가지 방식으로 그렇게 하고 있습니다.
판사가 틀릴 수 있고, 루프는 그것을 말해줍니다. 저희의 작성된 개발 주기(dev cycle)는 이렇습니다: 판사가 위반 사항을 발견한다 → 우리는 작가의 프롬프트를 수정하거나, 판사가 잘못했을 경우 판사를 수정한다 → 이를 기록하고(log) → 재실행합니다. 이러한 겸손함은 결정론적 게이트(deterministic gates)에도 적용됩니다. 저희는 '결점(flaw)'이라는 단어를 금지했습니다 — 돌 안에 있는 자국들은 결점이 아니라 특징이기 때문입니다. 그러자 비서가 온화한 광택 등급을 설명하며 그것이 *'결점이 아니라, 단순히 이 등급이 5나 6이 아닌 4인 이유 중 일부일 뿐이다'*라고 말했고, 정규표현식(regex)은 스크립트에서 가장 솔직한 문장을 실패 처리했습니다. 그래서 금지 규칙을 좁혔습니다: 수정적인 '결점이 아니다'는 이제 통과하지만, '이 돌에는 결점이 없다'와 같은 완벽함 주장(
Part IV — 우리가 굳이 할 필요가 없었던 세 가지 논쟁
판단자(Judge)가 존재하게 되었을 때 실제로 변화한 점은 다음과 같습니다. AI 팀들이 보통 취향, 연차, 또는 벤더의 평판에 따라 결정하던 세 가지 결정 사항들이, 이전과 이후에 동일한 수치를 읽음으로써 결정되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기