예방할 수 없는 AI 에이전트의 실패를 어떻게 격리할 것인가?
요약
AI 에이전트의 불가피한 오류를 관리하기 위해 '폭발 반경(Blast radius)'을 설계하고 제어하는 전략을 다룹니다. 에이전트의 권한을 신뢰도에 맞춰 제한하고, 비용이 큰 작업에만 인간의 개입을 허용하여 리스크를 격리하는 방법을 제시합니다.
핵심 포인트
- 에이전트의 권한 범위를 설정하여 오류 발생 시의 폭발 반경을 제어해야 함
- 에이전트의 역량은 측정된 신뢰도 수준을 초과해서는 안 됨
- 모든 작업이 아닌, 되돌릴 수 없거나 비용이 큰 작업에만 인간 참여(HITL)를 적용
- 실패를 추적하고 되돌릴 수 있도록 로그, 드라이 런, 소프트 삭제 등의 설계 필요
이 시리즈의 모든 부분은 한 가지 사실을 조용히 전제하고 있습니다. 에이전트는 때때로 틀릴 것이라는 점입니다. Part 1에서는 기준을 "수용 가능한 수준의 오류"로 설정했습니다. Part 3에서는 그 빈도를 측정했습니다. 따라서 마지막 질문은 어떻게 하면 실패를 영원히 막을 수 있느냐가 아닙니다. 제품 출시 여부를 실제로 결정짓는 질문은 이것입니다: 에이전트가 틀렸을 때, 발생할 수 있는 최악의 상황은 무엇인가?
그 최악의 상황은 고정되어 있지 않습니다. 그것은 설계상의 선택이며, 대부분의 팀이 의도적으로 내리지 않는 선택이기도 합니다.
폭발 반경(Blast radius)은 당신이 선택하는 것입니다
두 에이전트가 동일한 오답을 내놓았습니다. 하나는 사람이 보낼 수 있도록 이메일 초안을 작성했습니다. 다른 하나는 이메일을 직접 발송했습니다. 하나는 환불을 제안했습니다. 다른 하나는 환불을 실행했습니다. 동일한 실수임에도 결과는 완전히 다릅니다. 에이전트가 틀렸을 때 어느 정도의 권한을 가질지를 누군가가 결정했기 때문입니다. 당신은 에이전트가 옳은 일을 하기를 바라는 것이 아니라, 에이전트에게 허용된 행동 범위를 선택함으로써 폭발 반경(Blast radius)을 설정합니다.
가드레일(Guardrails): 역량(Capability)을 검증된 신뢰도에 맞추십시오
에이전트에게 업무가 허용하는 최소한의 권한만 부여하십시오. 쓰기 전에 읽게 하고, 실행하기 전에 제안하게 하십시오. 에이전트가 획득한 측정된 신뢰도보다 더 위험한 행동을 허용하는 것은 당신이 선택한 부채(Liability)입니다. 만약 Part 3에서 특정 단계의 정확도가 80%라고 말했다면, 그 단계는 감독 없이 돈을 움직일 수 없습니다. 역량(Capability)은 신뢰도를 따라야 하며, 신뢰도는 이제 당신이 보유한 수치입니다.
비용이 많이 드는 실패에만 인간을 투입하십시오
인간 참여(Human-in-the-loop)는 에이전트를 구축할 가치가 있게 만드는 속도를 저해하는 "모든 것을 승인하기"가 아닙니다. 그것은 잘못된 행동이 되돌릴 수 없거나 비용이 많이 드는 소수의 행동에 대한 게이트(Gate)입니다. 즉, Part 1에서 언급한 결격 사유가 되는 실패들입니다([알려진 남용 모드는 OWASP LLM Top 10에 목록화되어 있습니다]). 되돌릴 수 있고 비용이 저렴한 모든 것은 스스로 작동하게 하십시오. 되돌릴 수 없는 모든 것은 사람을 기다리게 하십시오.
실패를 되돌릴 수 있고 가시화할 수 있게 만들기
되돌릴 수 있는 작업을 선호하고, 이를 되돌리는 데 충분한 로그를 남기십시오. 드라이 런 (dry-run) 모드, 소프트 삭제 (soft delete), 확인 단계 (confirmation step) 등은 사고를 단순한 실수로 되돌려 놓습니다. 또한, 볼 수 없는 것은 격리할 수 없으므로 모든 동작을 추적(trace)하십시오. 추적된 실패는 몇 분 안에 포착되어 여러분의 평가 세트 (eval set) (Part 2)의 새로운 사례가 됩니다. 루프가 완성됩니다. 격리는 신뢰성을 측정하는 바로 그 요소에 자양분을 공급합니다.
이것이 이번 시리즈의 전부입니다. 기준을 정의하고, 이를 측정할 평가 세트를 구축하며, 신뢰성을 하나의 분포 (distribution)로 취급하고, 비용을 예산화하며, 예방할 수 없는 실패를 격리하십시오. 이 중 어느 것도 에이전트를 완벽하게 만들지는 않습니다. 하지만 이 모든 과정은 여러분이 실제로 출시 (ship)할 수 있는 에이전트를 만들어 줍니다.
결코 실패하지 않는 에이전트를 구축할 수는 없습니다. 하지만 실패가 당신에게 해를 끼치지 못하는 에이전트는 구축할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기