판단 회로(Judge Circuits): LLM의 출력 형식 변화에 따른 평가 불일치 메커니즘 분석
요약
LLM-as-a-judge 패러다임에서 출력 형식의 변화가 평가 결과의 불일치를 유발하는 내부 메커니즘을 분석한 연구입니다. PEAP 기법을 통해 Gemma-3, Qwen2.5, Llama-3 모델 내에서 판단을 담당하는 공통된 '잠재 평가자(Latent Evaluator)' 서브 그래프를 발견했습니다. 연구 결과, 모델은 공유된 계산 경로를 통해 판단 신호를 생성하지만, 이를 출력 형식에 맞게 매핑하는 과정에서 형식 특화적인 브랜치가 개입하여 불일치가 발생함을 밝혀냈습니다.
핵심 포인트
- 출력 형식(척도 vs 레이블)의 변화가 LLM의 평가 점수에 체계적인 불일치를 유발함
- Gemma-3, Qwen2.5, Llama-3 등 다양한 모델에서 판단을 담당하는 공통된 MLP 서브 그래프 존재 확인
- 해당 서브 그래프를 제거(zero-ablating)할 경우 세계 지식은 유지되나 판단 능력만 선택적으로 상실됨
- 판단 신호는 공유된 트렁크에서 생성되나, 형식 특화적인 터미널 브랜치를 통해 출력 형식으로 매핑됨
- 현재의 벤치마크 신뢰도 비교가 평가 품질이 아닌 포맷터 기하학(formatter geometry)에 영향을 받을 수 있음
LLM-as-a-judge(판단자로서의 LLM)는 대규모 모델 출력물을 채점하는 지배적인 패러다임이 되었으나, 동일한 모델이라도 출력 형식(예: 1-5점 척도 vs True/False 레이블)이 변경되면 체계적으로 다른 점수를 부여합니다. 이러한 형식 유도 불일치(format-induced inconsistencies)에 대한 기존의 진단은 입출력 수준에 머물러 있습니다. 본 연구에서는 위치 인식 엣지 어트리뷰션 패칭(Position-aware Edge Attribution Patching, PEAP)을 사용하여 Gemma-3, Qwen2.5, Llama-3의 내부 메커니즘을 인과적으로 조사합니다. 연구 결과, 구조적 이해(structured understanding) 및 개방형 선호도(open-ended preference) 과업 전반에 걸친 판단은 중간 및 후기 다층 퍼셉트론(MLPs) 내의 희소하고 일반화된 잠재 평가자(Latent Evaluator) 서브 그래프를 공유한다는 것을 발견했습니다. 아키텍처적으로 모듈화된 모델에서 이 서브 그래프를 제로-어블레이션(zero-ablating)하면 세계 지식(world knowledge)은 유지되면서 판단 능력은 붕괴됩니다. 추상적 판단을 출력 형식으로부터 구조적으로 분리함으로써, 우리는 연구 대상인 오픈 웨이트(open-weight) 모델에서 발생하는 형식 유도 불일치에 대한 기계론적 설명(mechanistic account)을 제공합니다. 즉, 공유 트렁크(shared trunk)에서 계산된 연속적인 판단 신호가 취약하고 형식 특화적인 터미널 브랜치(terminal branches)를 통해 매핑되며, 이로 인해 요청된 출력 형식의 하류(downstream)에서 형식에 독립적인 선호도가 격리될 수 있습니다. 우리의 연구 결과는 형식 간의 벤치마크 수준 신뢰도 비교가 평가 품질보다는 포맷터 기하학(formatter geometry)을 부분적으로 측정하고 있음을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기