POLAR: 도메인 온톨로지를 활용한 툴 호출 LLM 에이전트의 위험 예방
요약
본 논문은 LLM 툴 호출 에이전트가 작동하는 동적 환경에서 운영상의 위험을 사전에 예방하기 위한 가드레일 프레임워크 POLAR를 제안합니다. POLAR는 구조화된 2계층 온톨로지를 활용하여 각 행동의 '되돌릴 수 있는 정도(reversibility)'를 평가하고, 임계값에 실패하는 호출은 실행 전에 가지치기하여 에이전트의 안전성을 높입니다.
핵심 포인트
- POLAR는 2계층 온톨로지를 사용해 구조적이고 감사 가능한 가드레일을 제공합니다.
- 되돌릴 수 있는 정도(reversibility)를 평가하여 위험한 행동을 사전에 가지치기합니다.
- 항공사 도메인 에이전트에서 평균 작업 보상을 향상시켰습니다 (0.11점 -> 0.18점).
- 모든 도메인에 적용된 것은 아니며, 일부 모델/도메인에서는 성능 저하가 관찰되었습니다.
LLM 툴 사용 에이전트는 많은 행동이 운영상의 위험을 수반하는 동적 환경에서 작동합니다. 그러나 대부분의 안전 메커니즘은 오류가 발생한 후에만 반응합니다. 기존의 사전 예방적 접근 방식들은 에이전트를 사고 과정(chain-of-thought) 숙고에 맞춰 미세 조정하거나, 자연어 가드레일을 런타임 검사로 컴파일하지만, 구조적이고 감사 가능한 판결을 노출하지는 못합니다. 우리는 작은 툴 호출 에이전트를 위한 가드레일 프레임워크인 POLAR를 제안하며, 이는 구조화된 2계층 온톨로지를 통해 되돌릴 수 있는 정도(reversibility)를 평가합니다. POLAR는 후보 역순 시퀀스(candidate inverse sequence)를 도출하여 각 행동에 등급별 되돌릴 수 있는 점수를 할당하고, 임계값에 실패하는 호출은 실행 전에 가지치기(pruned) 합니다. 6개의 에이전트 모델에 걸쳐 $ au^2$-bench에서 평가된 결과, POLAR는 항공사 도메인(airline)의 4개 에이전트에서 평균 작업 보상(mean task reward)을 0.11점에서 0.18점 향상시켰지만, 전체적으로 개선되는 모델-도메인 셀은 18개 중 8개에 불과했습니다. 소매업(retail) 및 더 강력한 에이전트에서는 종종 성능이 저하되었습니다. POLAR는 감사 가능한 구조적 검사를 제공하며 그 작업 유용성 상충 관계(task-utility trade-offs)를 특성화합니다. 보상은 예방된 피해의 직접적인 측정치가 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기