하나의 인간, $N$개의 에이전트: 부정확하고 상관관계가 있는 신뢰도 하의 LLM 에이전트 함대를 위한 감사 예산 할당
요약
제한된 감사 예산 하에서 다수의 LLM 에이전트를 효율적으로 검증하기 위한 수학적 모델을 제안합니다. 에이전트의 신뢰도가 부정확하거나 오류 간 상관관계가 존재할 때, 신뢰도 기반 감사가 무작위 감사보다 비효율적이게 되는 임계값을 분석합니다.
핵심 포인트
- 에이전트 신뢰도의 부정확성과 오류 상관관계를 가우시안 코풀라로 모델링
- 신뢰도 기반 감사가 무작위 감사보다 성능이 떨어지는 임계값(δ*) 규명
- 예산이 줄어들수록 신뢰도 기반 감사의 유효 임계값은 상승함
- 오픈 웨이트 모델 대비 폐쇄형 모델이 더 유익한 신뢰도 정보를 제공함
단 한 명의 인간이 라운드당 $B ext{ (단, } B ext{는 } N ext{보다 훨씬 작음)}$ 회의 감사 예산 하에서 $N$개의 LLM 에이전트를 감사해야 하며, 이때 에이전트가 스스로 보고한 신뢰도(confidence)의 안내를 받습니다. 이 신뢰도는 적대적으로 부정확하게 보정(miscalibrated)되어 있을 수 있으며, 오류 간의 상관관계(correlated errors)가 존재할 수 있습니다. 우리는 이를 2단계 가우시안 코풀라(two-level Gaussian copula) 상의 예산이 제한된 노이즈가 있는 검사(budgeted noisy inspection)로 모델링하며, 신뢰도 순위 기반 감사가 무작위 감사보다 extit{더 나쁜} 결과가 나타나기 시작하는 부정확성 임계값(miscalibration threshold) $\delta^$를 찾아냅니다. 두 가지 사전 기대 사항이 뒤바뀝니다: $\delta^$는 예산이 줄어들수록 extit{상승}하며, 계열 간 상관관계(cross-family correlation)는 낮지 않습니다—즉, 공유된 난이도가 계보(lineage)보다 더 지배적입니다. 5개의 오픈 웨이트(open-weight) LLM은 운영상 무용(거의 일정함)한 신뢰도를 보여주며, 신뢰 구간(CI)이 임계값을 가로지르더라도 점 추정치는 임계값에 도달하거나 이를 넘어섭니다. 반면, 하나의 폐쇄형(proprietary) 모델은 유익한 정보를 제공하며 임계값 아래에 위치합니다. 우리는 extit{공허한(vacuous)} 감독을 위한 정량적 기준을 제시하며, 기록된 트레이스(traces)에서 정책을 재실행함으로써 이러한 순위가 유효함을 확인합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기