AI 평가 시리즈 (01): AI 평가가 어려운 이유 — 불확실성, 주관성, 그리고 다차원성
요약
AI 애플리케이션 평가가 전통적인 소프트웨어 테스트와 달리 어려운 이유를 비결정론적 출력, 주관적 품질, 다차원적 품질의 관점에서 분석합니다. 효과적인 평가를 위해 시나리오 정의와 다각도 채점 기준(Rubric)의 필요성을 강조합니다.
핵심 포인트
- 비결정론적 특성 때문에 여러 번의 샘플링을 통한 평균값 확인이 필요함
- 주관적 품질 문제를 해결하려면 대상(Audience)에 따른 명확한 루브릭 정의가 필수적임
- 정확성, 관련성, 완전성 등 다차원적 지표로 분해하여 평가해야 정보 손실을 줄임
- 인간 평가는 가장 정확하지만 비용이 높고 속도가 느린 기준선 역할을 함
전통적인 소프트웨어 테스트의 가정
전통적인 소프트웨어 테스트는 세 가지 가정에 기반합니다:
- 결정론적 출력 (Deterministic output): 동일한 입력은 동일한 출력을 생성하며, 테스트는 재현 가능합니다.
- 정답 여부의 판정 가능성 (Correctness is decidable): 함수가 42를 반환한다면, 맞거나 틀리거나 둘 중 하나이며 명확한 기준이 존재합니다.
- 단일 차원 (Single dimension): 코드는 테스트를 통과하거나 통과하지 못하거나 둘 중 하나입니다. "어느 정도 통과함"과 같은 중간 단계는 없습니다.
AI 애플리케이션은 이 세 가지 모두를 깨뜨립니다.
세 가지 근본적인 문제
문제 1: 비결정론적 출력 (Non-Deterministic Output)
동일한 프롬프트 (Prompt)라도 오늘 Claude가 내놓는 응답과 내일 내놓는 응답이 다를 수 있습니다. temperature=0으로 설정하면 무작위성 (randomness)을 줄일 수는 있지만 완전히 제거할 수는 없습니다. 모델 업데이트는 동일한 입력에 대한 출력을 조용히 변화시킵니다.
엔지니어링 측면의 시사점:
# 전통적인 테스트
assert calculator(2, 3) == 5 # 100번 실행하면 100번 모두 통과함
...
여러 번 샘플링하여 평균을 내십시오. 보통 35번의 샘플링이면 충분하지만, 비용은 35배가 듭니다. 단 한 번의 실행 결과로 품질을 판단하지 마십시오.
문제 2: 주관적 품질 (Subjective Quality)
"Transformer가 무엇인지 설명해줘"라는 질문에는 수많은 정답이 존재할 수 있습니다. 10살 아이를 위한 설명과 머신러닝 (ML) 엔지니어를 위한 설명은 완전히 다르더라도 둘 다 "좋은 답변"이 될 수 있습니다.
주관성은 다음과 같이 나타납니다:
동일한 질문에 대해 대상에 따라 달라지는 서로 다른 좋은 답변들
→ 깊이 (Depth): 초보자 vs 전문가
→ 스타일 (Style): 비유 vs 방정식
...
해결책: 평가하기 전에 시나리오와 대상(audience)을 정의하십시오. 주관적인 판단을 구체적인 채점 루브릭 (Rubric)으로 변환하여, LLM-as-Judge가 따라야 할 명확한 기준을 제공하십시오.
문제 3: 다차원적 품질 (Multi-Dimensional Quality)
"AI 응답은 좋아야 한다"라는 문장은 단일 점수로는 포착할 수 없는 여러 독립적인 차원으로 분해됩니다:
정확성 (Accuracy): 콘텐츠가 사실과 일치하며 환각 (hallucinations)이 없음
관련성 (Relevance): 응답이 사용자의 실제 질문에 답변함
완전성 (Completeness): 질문의 핵심 측면들을 모두 다룸
...
응답이 정확하지만 불완전할 수 있고, 혹은 완전하지만 불분명할 수도 있습니다. 5개의 차원을 하나의 숫자로 압축하면 너무 많은 정보가 손실됩니다.
네 가지 평가 방법
어떤 평가 방법도 모든 상황에 적용될 수는 없습니다. 각 방법은 비용을 수반합니다. 따라서 선택은 시나리오와 예산에 따라 달라집니다.
Method Accuracy Speed Cost Best for
──────────────────────────────────────────────────────────────
Human evaluation Highest Slow (days) High Baseline setup, periodic sampling
...
인간 평가 (Human Evaluation)
강점: 가장 높은 정확도를 가지며, 미묘한 품질 차이를 포착하고, 다른 모든 방법의 기준선(baseline) 역할을 합니다.
약점: 느리고 비싸며, 확장성이 떨어집니다. 평가자 한 명이 하루에 50~100개의 샘플을 검토할 수 있으며, 1,000개 샘플은 2주가 걸립니다.
사용 방법: 각 핵심 시나리오별로 '골드 테스트 세트(gold test set)'를 구축합니다 (인간이 라벨링한 약 100개 샘플). 이를 참조 표준으로 사용하고, 자동 평가 방법을 이 골드 세트에 대한 결과와 비교하여 검증합니다.
규칙/자동 지표 (Rule / Auto Metrics)
강점: 밀리초 단위의 속도, 거의 제로에 가까운 비용, CI(지속적 통합)에 쉽게 통합할 수 있습니다.
약점: 커버리지(범위)가 제한적이며, 의미론적 품질을 평가할 수 없습니다. BLEU/ROUGE는 표면 수준의 단어 중첩도를 측정할 뿐, 의미가 정확한지를 측정하지 못합니다.
# 유용한 자동 지표
def check_format(output: str, schema: dict) -> bool:
"""출력이 JSON 스키마를 준수하는지 확인합니다?"""
...
사용 방법: 레이어 2 구조적 검사 — 형식 준수 여부, 길이 유효성 검사, 금지 구문 필터링에 사용합니다. 의미론적 품질 판단에는 사용하지 않습니다.
LLM-as-Judge (LLM을 심판으로 활용)
강점: 확장성이 좋고, 의미론을 이해하며, 추론이 필요한 품질 차원을 평가할 수 있습니다.
약점: 편향(bias)에 취약합니다 (Article 03에서 자세히 다룹니다). 인간 평가 대비 비용은 약 1/10 수준이지만, 규칙 기반 방법보다는 100배 더 비쌉니다.
JUDGE_PROMPT = """다음 AI 응답을 평가하세요 (차원별 1-5점):\n\nDimensions:\n..."""
**사용 방법:** 자동 지표가 커버할 수 없는 의미론적 품질 차원의 주요 방법입니다.
### A/B 테스트
**강점 (Strengths):** 실제 사용자 행동을 테스트하며, 비즈니스 가치에 가장 가깝습니다. 사용자의 클릭, 채택 및 전환율은 모델의 자기 평가 (self-assessment)보다 더 신뢰할 수 있습니다.
**약점 (Weaknesses):** 충분한 트래픽이 필요하며 (통계적 유의성을 확보하려면 일반적으로 수백 번의 노출이 필요함), 수주가 소요되고, 온라인 실험 인프라가 필요합니다.
**사용 방법 (How to use):** 비즈니스 영향력을 확인하기 위해 대규모 변경 사항 (새로운 모델 버전, 프롬프트 (Prompt) 재작성)을 검증할 때 사용합니다. 개발 중 빠른 반복 (rapid iteration)에는 적합하지 않습니다.
## 계층별 방법론 결합 (Combining Methods by Layer)
실무에서는 세 가지 접근 방식이 계층별로 구성됩니다:
개발 (Development, 빠른 반복):
규칙 검사 (Rule checks, 자동) + LLM-as-Judge (샘플링)
→ CI는 모든 커밋에 대해 형식 검사 (format checks)를 실행합니다
...
## 요약 (Summary)
1. **결정론의 함정 (The determinism trap)**: 전통적인 "assert" 방식의 사고는 AI 평가에 적용되지 않습니다. 단일 단언 (assertion)보다 통계적 수치를 포함한 다수의 샘플이 더 신뢰할 수 있습니다.
2. **주관성은 장애물이 아니다 (Subjectivity isn't a blocker)**: 명확한 시나리오 정의, 대상(audience) 명시, 그리고 채점 루브릭 (scoring rubrics)을 통해 주관적인 품질을 운영 가능한 수준으로 만들 수 있습니다.
3. **단 하나의 최선의 방법은 없다 (No single best method)**: 규칙 기반은 빠르지만 커버리지가 좁고, 인간 평가 (human evaluation)는 정확하지만 비용이 많이 들며, LLM-as-Judge는 주요 작업 부하에 대해 가장 좋은 비용 효율성을 제공하며, A/B 테스트는 최종적인 상업적 검증을 제공합니다.
다음 기사에서는 실전 편을 다룹니다: "AI 응답은 좋아야 한다"라는 모호한 목표를 어떻게 측정 가능한 L1/L2/L3 3계층 지표 시스템으로 분해할 수 있는지에 대해 알아봅니다.
_실제 기업급 워크플로우에서 검증된 AI 에이전트와 기술의 큐레이션 마켓플레이스인 [PrimeSkills](https://primeskills.store)를 확인해 보세요. 군더더기 없이 실제로 작동하는 것들만 모았습니다._
_제 [홈페이지](https://home.wonlab.top/en)에서 더 유용한 지식과 흥미로운 제품들을 찾아보세요._
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기