스스로 결정할 수 없음: LLM은 에이전트 검증자가 확인할 경계를 그릴 수 없다
요약
본 논문은 LLM 기반 에이전트의 자율적 결정 능력에 대한 근본적인 한계를 지적합니다. 특히 금융, 의료 등 외부 규제가 강한 분야에서 에이전트가 스스로 규칙을 정할 수 있다는 가정은 위험하며, 기존 검증 방식으로는 모든 상황을 감시하기 어렵습니다. 연구진은 CoVer(corroborate-then-verify)라는 새로운 프레임워크를 제안하여, 만장일치에 의존하는 대신 개입이 필요한 경우에만 검사를 허용하고 결정론적 재작성을 통해 안전성을 확보해야 한다고 주장합니다.
핵심 포인트
- LLM 에이전트의 자율적 결정 능력은 근본적인 한계를 가짐.
- 외부 규제 환경에서는 사전에 고정된 규칙 분할로는 부족함.
- CoVer 프레임워크는 만장일치 대신 개입 시에만 검사를 허용함.
- 자체 결정 가능성은 모델의 능력이 아닌, 검증자가 구축해야 할 경계임.
에이전트를 위한 검증자는 두 가지 종류의 규칙에 직면합니다. 고정된 검사가 해결할 수 있는 규칙과 심판(judge)이 필요한 규칙입니다. 자체적인 검사를 도출하는 팀은 이 분할을 사전에 고정합니다. 금융, 의료, 법률처럼 요구사항이 외부에서 오는 경우, 에이전트는 자신이 작성하지 않은 규칙을 강제하며, 따라서 그 분할은 런타임(runtime)으로 넘어가고 모든 액션의 모든 규칙에 대한 모든 술어(predicate)마다 검토자가 감사할 수 없는 속도로 반복됩니다. 모든 에스컬레이션 스킴(escalation scheme)은 모델이 스스로 그 결정을 내릴 수 있다고, 즉 그것이 자체 결정 가능하다고 가정합니다. EU AI Act, FINRA 가이드라인, 배포된 신용 에이전트를 포함한 6개의 코퍼스에서 우리는 세 개의 연구소에서 구축한 네 가지 모델로부터 약 22,000개의 레이블을 수집했습니다. 이들은 답이 명백할 때는 거의 완벽하게 동의하지만, 규제 텍스트에서는 무너지고; 그들의 오류는 반대 방향으로 발생하여 어떤 모델도 보수적인 선택지로 신뢰할 수 없으며; 배포된 에이전트 자체 규칙 세트에 대해서는 고정된 검사로 충분하다고 과장하며, 결코 에스컬레이션되지 않는 방향으로 함께 오류를 범합니다. 우리는 CoVer(corroborate-then-verify)를 도입했는데, 이는 만장일치(unanimity)를 지명(nomination)으로 취급하여, 해당 술어에 대한 검사가 개입을 견뎌낼 때만 허용하고, 에이전트가 작성할 수 없는 필드를 읽고 결정론적 재작성(deterministic rewording) 하에 유지합니다. 이 게이트는 상호확증(corroboration)이 잘못 허용한 대부분의 것을 거부하며, 우리는 이를 조정하기보다 커버리지(coverage) 측면에서 보고합니다. 명백한 대안은 참조 심판(reference judge)과의 합의이지만, 이는 아무것도 인증하지 못합니다. 이 방법은 보정 밴드(calibration bands)를 거치며 30%에서 77%까지 상승하지만, 실제로 결정 가능한 부분은 움직이지 않습니다. 왜냐하면 기소된 인구 집단으로부터 나온 심판은 공유하는 사각지대(blind spot)를 정당화하기 때문입니다. 자체 결정 가능성은 모델로부터 이끌어낼 수 있는 능력이 아니라 검증자가 구축해야 하는 경계입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기