LLM 에이전트의 도구 환각에 대한 폐쇄 세계 해결책
요약
본 논문은 LLM 에이전트가 존재하지 않는 도구를 호출하거나 스키마에 없는 인수를 전달하는 '도구 환각(Tool Hallucination)' 문제를 다룹니다. 기존의 방어책들이 이 구조적 사각지대를 해결할 수 없음을 증명하며, 폐쇄 세계 해결사 및 새로운 벤치마크를 제시합니다.
핵심 포인트
- 도구 환각은 선택/게이팅 방식으로는 막을 수 없는 근본적인 문제임.
- 폐쇄 세계 해결사는 '무엇을 계산하는가'보다 '어디에 위치해야 하는가'에 초점을 맞춤.
- 환각 방어는 모든 인과적 게이트보다 선행되어야 함을 증명함.
- Hallucinated-Tools Benchmark (HTB)를 공개하여 연구 커뮤니티의 비교 가능성을 높임.
도구가 증강된 대규모 언어 모델(LLM) 에이전트는 어떤 도구 선택 또는 도구 보안 방법으로도 해결하지 못하는 방식으로 실패합니다. 즉, 존재하지 않는 도구를 호출하고 스키마가 선언하지 않은 인수를 전달합니다. 기존의 방어책들은 올바른 도구를 고르거나(선택), 에이전트가 실제 도구로 할 수 있는 것을 제약하는 방식(게이팅)인데, 이 둘 다 발화된 호출이 아예 실재하는 도구를 참조한다는 전제를 깔고 있습니다. 우리는 이것이 구조적인 사각지대임을 보여줍니다: 환각된 호출은 본질적으로 어떤 게이트도 결정할 수 없기 때문에 만들어진 것이므로, 어떤 게이트도 이를 거부할 수 없습니다. 이 논문은 주로 측정 및 벤치마크 연구입니다. 저희는 도구 환각에 대한 다섯 가지 클래스 분류(H1-H5)를 제시하고, 참고 지표로 Resolution Rung을 소개합니다. 이는 학습이 필요 없는 폐쇄 세계 해결사(레지스트리 멤버십 및 시그니처 체크 추가)이며, 그 관심사는 무엇을 계산하는지가 아니라 어디에 위치해야 하는가입니다. 우리는 환각 방어는 모든 인과적 게이트보다 선행되어야 함을 증명하고, 하나의 축소 불가능한 잔여물(유효 호출과 구별할 수 없는 도용 인수 스키마)을 특성화합니다. 두 가지 호출 표면에서 총 10개의 호스팅된 모델에 걸쳐 322개의 실제 환각을 측정했습니다. 조작된 도구 호출은 제약이 없는 raw-JSON 표면에 집중되어 있었으며(34개 대 3개), 모델 규모는 도움이 되지 않았습니다(675B 모델과 7-8B 모델이 동일한 수준). 이후 Model Context Protocol로 확장하여, 여러 서버를 하나의 네임스페이스로 병합하는 과정에서 단일 레지스트리가 표현할 수 없는 환각 표면을 생성합니다(두 번째 분류 M1-M5). 실제 MCP 표면에서는 154개의 환각을 측정했는데, 여기에는 단일 레지스트리 표면에서는 깨끗했던 최첨단 모델들까지 포함되었습니다. 이는 충돌과 섀도잉이 병합에 구조적으로 관련되어 있기 때문입니다. 저희는 모든 해결사가 제출물 전반에 걸쳐 비교 가능하도록 버전 관리된 Hallucinated-Tools Benchmark (HTB)를 공개합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기