SSCBench: 도구 사용 LLM 에이전트의 결함 주입 테스트에 대한 증거적 유효성 평가
요약
본 논문은 도구 사용 LLM 에이전트의 신뢰성 평가에 필수적인 '결함 주입(Fault injection)' 기법에서 발생하는 증거적 유효성 문제를 체계적으로 연구합니다. 이를 위해 SSCBench라는 측정 프로토콜을 개발하고, 다양한 결함 연산자와 에이전트 구성을 통해 1,191개의 실험을 수행했습니다. 연구 결과, 채택된 행동의 해석은 반드시 최초 오류 시점과 일치할 필요가 없으며, 자동화된 분석만으로도 충분히 회복 가능한 복잡한 패턴을 보여주었습니다.
핵심 포인트
- LLM 에이전트 평가를 위한 증거적 유효성 문제 체계적 연구 제시
- SSCBench 프로토콜 개발 및 1,191개 결함 실행에 걸친 실험 수행
- 채택된 행동의 해석은 최초 오류 시점과 일치할 필요가 없음 입증
- 자동화 분석이 어려워도 채택을 회복하는 복잡한 패턴 확인
결함 주입(Fault injection)은 도구 사용 LLM 에이전트의 신뢰성을 평가하는 데 점점 더 많이 사용되고 있습니다. 그러나 에이전트 자체가 실행 중 어떤 권위 있는 관측치가 가시화될지 결정할 때, 결함 채택 결과가 어떻게 해석되어야 하는지에 대한 연구는 제한적이었습니다. 본 논문에서는 에이전트의 결함 주입 평가에서 이러한 증거적 유효성(evidential validity) 문제를 체계적으로 연구합니다. 우리는 어떤 관측치가 주입된 단언을 반박할 수 있는지 명시하고, 그것들이 영향을 받은 사실이 처음 사용되기 전에 가시화될 수 있는지 판단하며, 평가된 실행이 실제로 이 조건을 실현하는지 기록하는 측정 프로토콜을 개발합니다. 우리는 이 프로토콜의 인스턴스화로서 SSCBench를 구성하고, 두 개의 $ au$-bench 환경에서 1,191개의 결함 발생 실행에 걸쳐 네 가지 결함 연산자(fault operators)와 다섯 가지 에이전트 구성을 평가했습니다. 우리의 실험은 인정된 결함 사례와 에이전트 구성이 실행 전반에 걸쳐 상당히 다른 증거적 조건을 실현할 수 있으며, 적시 반증 주장(timely-counterevidence claim)을 뒷받침하는 모집단이 희소하거나 없을 때에도 집계 채택(aggregate adoption)이 여전히 잘 정의될 수 있음을 보여줍니다. 예를 들어, 반증이 결국 가시화된 44개의 채택 실행 중 오직 17개만이 첫 사용 전에 이를 받았고, 27개는 나중에 받았습니다. 또한 우리는 최초 오류 시점(first-error timing)과 이후의 입장 수정(later stance revision)이 일치할 필요가 없으며, 자동화된 궤적 분석(automated trajectory analysis)이 시간적 진단을 위해 필요한 첫 번째 결함 의존성 사건을 확실하게 복구하지 못하더라도 채택을 회복할 수 있음을 발견합니다. 우리는 실행에 의해 실현되는 증거적 조건과 주장별 해석을 뒷받침하는 모집단이 결함 주입 평가 자체의 일부이며, 적시 반증(pre-use counterevidence) 하에서 채택을 실패로 해석하기 전에 보고되어야 한다고 주장합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기