도구가 거짓말할 때: 손상된 도구 피드백 하에서의 수학적 에이전트 신뢰성
요약
본 연구는 에이전트가 사용하는 도구가 부정확하거나 잘못된 정보를 반환할 때, 이를 얼마나 잘 감지하고 수정하는지에 대한 신뢰성 문제를 다룹니다. 통제된 오염 프레임워크를 통해 네 가지 검증 설계 하에 에이전트를 평가한 결과, 필수적인 컨텍스트 반성이 성능을 100%로 완전히 복구함을 입증했습니다.
핵심 포인트
- 도구가 실패할 경우, 에이전트의 정확도는 크게 떨어질 수 있습니다.
- 필수 동일 컨텍스트 반성(Essential Self-Reflection)은 성능 저하를 100%로 복구합니다.
- 검증기(Verifier)의 가용성과 검증 정책은 신뢰성의 핵심 구성 요소입니다.
- 명시적 감지 후 전체 문제 재시작이 성공적인 복구 전략임을 보여줍니다.
수학 문제 해결은 종종 에이전트가 도구에 위임하고 암묵적으로 신뢰하는 결정론적 계산 단계를 필요로 합니다. 그러나 도구는 조용히 실패하여 그럴듯하지만 부정확한 결과를 반환할 수 있습니다. 에이전트는 손상된 도구 호출 출력을 얼마나 잘 감지하고 수정할 수 있을까요? 우리는 숨겨진 인터셉터가 표적화된 문제에서 도구 호출 결과를 그럴듯하게 잘못된 정보로 대체하는 통제된 오염 프레임워크를 통해 이를 연구합니다. 우리는 네 가지 검증 설계(검증 없음 (기준선), 필수 동일 컨텍스트 반성, 선택적 신규 컨텍스트 검증, 선택적 구조적 검증) 하에 31개 문제에서 에이전트를 평가했습니다. 검증이 없을 경우, 오염은 정확도를 100%에서 72.4%까지 극적으로 떨어뜨립니다. 필수 반성은 이 성능을 100%로 완전히 복구합니다. 선택적 검증은 모델이 이를 능동적으로 호출할 때만 정확도를 향상시킵니다. 우리의 결과는 확인 빈도가 강건성 차이와 밀접하게 관련되어 있는 반면, 불균등한 호출은 검증기 품질의 통제된 비교를 방해한다는 것을 보여줍니다. 지원적인 복구 실험은 명시적 감지 후 전체 문제 재시작이 100%의 경우에 성공함을 보여줍니다. 이러한 발견은 검증기의 가용성과 검증 정책이 수학적 에이전트 신뢰성의 별개 구성 요소임을 입증합니다. 필수 정책은 검증을 강제하는 반면, 선택적 정책은 모델 자체의 호출 결정에 의존합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기