AI Human-in-the-Loop: 에이전트가 행동하기 전 5가지 중단 게이트 (Stop Gates)
요약
AI 에이전트의 자율적 행동을 제어하기 위한 'Human-in-the-Loop' 설계 원칙과 5가지 중단 게이트(Stop Gates)를 소개합니다. 승인되지 않은 입력, 외부 통신, 자금 이동 등 위험 요소가 발생하기 전 기술적 중단을 설정하는 구체적인 방법론을 다룹니다.
핵심 포인트
- 단순 승인이 아닌 기술적으로 행동을 방지하는 'Hard Stop' 설정 필요
- 입력, 예외, 외부 행동 등 5가지 중단 게이트 적용 권장
- 신뢰할 수 있는 미리보기와 명시적 결정 프로세스 구축
- 제안된 행동과 결정 사항을 기록하는 영수증(receipt) 시스템 필요
AI Human-in-the-loop (인간 참여형 제어)는 워크플로우가 실행 전에 중단되고, 지정된 검토자에게 실제로 어떤 일이 일어날지를 보여줄 때만 유용합니다. 승인되지 않은 입력, 외부 통신, 자금 이동, 새로운 예외 상황, 그리고 권한이 부여된 변경 사항이 발생하기 전에 강력한 중단(hard stop)을 설정하십시오. 그런 다음 신뢰할 수 있는 미리보기(preview), 명시적인 결정, 그리고 영수증(receipt)을 요구해야 합니다.
짧은 답변 및 범위
승인된 테스트 데이터를 사용하는 초보자용 워크플로우를 기준으로 2026-07-29에 검토되었습니다. 범위에는 자율적인 전송, 게시, 결제, 삭제, 코드 실행 및 권한 변경은 제외됩니다.
인간의 검토는 모델이 이미 행동을 취한 후 단순히 장식용으로 누르는 "승인" 버튼이 아닙니다. 다음과 같은 요소가 필요합니다:
- 기술적으로 행동을 방지하는 중단(stop);
- 결정에 필요한 충분한 맥락을 가진 지정된 검토자;
- 모델이 작성한 안심 문구가 아닌, 신뢰할 수 있는 시스템 상태를 기반으로 구축된 미리보기(preview);
- 승인(approve), 거절(reject), 수정(edit), 수동 전환(return-to-manual) 선택지;
- 제안된 행동과 인간의 결정 사항을 보여주는 영수증(receipt).
NIST AI RMF Govern 3.2는 인간-AI 구성 및 감독을 위한 역할과 책임을 정의할 것을 요구합니다. OECD AI 원칙은 맥락에 적합한 인간의 주체성(human agency)과 감독을 요구합니다. 이것들은 거버넌스(governance)의 결과물이지, 즉시 사용 가능한 인터페이스나 검토자가 모든 오류를 잡아낼 것이라는 증거가 아닙니다.
5가지 중단 게이트(Stop Gates)를 복사하십시오
AI 보조 워크플로우가 권한을 부여받기 전에 모든 게이트를 적용하십시오.
| 중단 게이트 (Stop gate) | 중단 조건 (Stop when) | 검토자가 확인해야 할 사항 | 안전한 결과 |
|---|---|---|---|
| 입력 (Input) | 입력에 비밀 정보, 개인 기록, 기밀 파일 또는 승인되지 않은 소스가 포함된 경우 | 소스 식별 정보, 데이터 분류, 편집(redactions) 및 허용된 사용 규칙 | 거절, 편집 또는 가상의 입력 사용 |
| ... | |||
| 이것들은 Builderlog의 중단 게이트이며, NIST, OECD 또는 OWASP 체크리스트의 본문이 아닙니다. |
다음 제어 블록(control block)을 복사하십시오:
제안된 행동 (Proposed action):
트리거된 중단 게이트 (Stop gate triggered):
입력 소스 및 분류 (Input source and classification):
...
"향후 모든 행동 승인" 옵션은 경계 설정을 무력화합니다. 승인은 표시된 정확한 미리보기, 목적지 및 페이로드(payload)에 대해서만 적용되어야 합니다.
작업 사례: 고객 답변 초안
워크플로가 가상의 고객 질문과 공개 FAQ 텍스트를 받는다고 가정해 봅시다. 시스템은 답변을 제안하지만 실제 편지함에는 접근할 수 없습니다.
입력 게이트(Input gate)는 질문이 가상이며 FAQ가 승인된 출처임을 확인합니다. 예외 게이트(Exception gate)는 질문이 알려진 정책과 일치하지 않거나 두 FAQ 구절이 충돌할 경우 작동합니다. 외부 행동 게이트(External-action gate)는 실제 메시지가 전송되기 전에 항상 작동합니다.
검토자는 목적지, 최종 답변, 인용된 FAQ 섹션, 누락된 사실 및 편집 뷰(edit view)를 확인합니다. '거부(Reject)'를 선택하면 기존의 수동 경로가 그대로 유지됩니다. '승인(Approve once)'을 선택하면 표시된 메시지만 표시된 목적지로 전송됩니다. 콘텐츠가 변경되면 결정은 무효화되며 새로운 미리보기가 필요합니다.
이 설계가 답변의 정확성을 증명하는 것은 아닙니다. 이는 초안 작성과 전송을 분리하며, 인간의 결정을 관찰 가능하게 만듭니다.
승인 대화창이 공격 수단이 될 수 있습니다
OWASP는 신뢰할 수 없는 콘텐츠가 승인 요청이 표시되는 방식을 조작하는 "HITL 대화 위조(HITL dialog forging)"를 설명합니다. 모델이나 웹페이지가 테스트를 통과했다고 주장하거나, 목적지를 숨기거나, 파괴적인 행동의 이름을 변경하거나, 위험한 요청을 일상적인 것으로 위장할 수 있습니다.
이는 행동을 제안하는 동일한 모델이 왜 승인이 안전한지에 대해 요약하는 것을 신뢰해서는 안 된다는 것을 의미합니다.
다음 사항을 렌더링하기 위해 신뢰할 수 있는 컨트롤러(controller)를 사용하십시오:
- 문자 그대로의 목적지 또는 리소스 식별자;
- 원시 명령(raw command), 차이점(diff) 또는 최종 외부 페이로드(outbound payload);
- 관련된 권한;
- 각 사실의 출처;
- 명확한 되돌릴 수 없는 행동에 대한 경고;
- 승인의 정확한 범위 및 만료 시간.
검토자는 여전히 잘못된 결정을 내릴 수 있습니다. 기술적 중단(technical stop), 최소 권한(least privilege), 샌드박스(sandbox), 로깅(logging) 및 롤백(rollback)은 별도의 통제 수단으로 남습니다.
재정의, 오류 및 진행 불가 결정 기록
NIST 플레이북(Playbook) 자료는 감독 역할을 문서화하고 재정의(overrides), 오류, 불만, 에스컬레이션(escalations), 그리고 진행(go) 또는 진행 불가(no-go) 결정을 측정할 것을 제안합니다. 또한 플레이북은 이것이 자발적이고, 조정 가능하며, 보편적인 순차적 체크리스트가 아니라고 명시합니다.
작은 워크플로우(workflow)는 다음과 같은 간단한 영수증(receipt)을 유지할 수 있습니다:
실행(Run):
게이트 트리거됨(Gate triggered):
검토자 결정(Reviewer decision):
...
반복되는 수정 사항과 예외 사항에 대해 영수증을 검토하십시오. 만약 검토자들이 미리보기(preview)를 확인하지 않고 관습적으로 승인(approve)을 클릭한다면, 해당 통제(control)는 제대로 작동하고 있지 않은 것입니다. 동일한 예외가 반복된다면, 권한을 확대하기 전에 소스(source)나 규칙(rule)을 업데이트하십시오.
실패 모드(Failure modes) 및 부적합 사례
인간의 검토는 검토자의 전문성 부족, 촉박한 시간, 유창한 텍스트에 대한 신뢰, 실제 대상(target)을 볼 수 없는 상황, 또는 너무 많은 승인 요청을 받는 등의 이유로 실패할 수 있습니다. 또한 중단 게이트(stop gate)가 데이터 노출이나 외부 쓰기(external write)가 이미 발생한 후, 즉 너무 늦은 시점에 배치될 수도 있습니다.
이 글을 법률, 고용, 금융, 컴플라이언스(compliance) 또는 보안 조언으로 취급하지 마십시오. 영향력이 큰 결정과 규제 대상 데이터는 맥락에 특화된 통제(controls)와 자격을 갖춘 검토가 필요합니다. 일부 읽기 전용(read-only)의 영향력이 낮은 작업은 동일한 승인 흐름이 필요하지 않을 수 있습니다. NIST 부록 C(Appendix C)는 감독(oversight)의 필요성이 시스템과 맥락에 따라 다르다고 명시합니다.
관련 Builderlog 현장 매뉴얼:
- AI Automation for Small Business: A 10-Point First-Task Scorecard
- The OpenAI–Hugging Face Incident: AI Agent Safety Checks
최종 결정 및 출처
인간을 결과가 초래되는 행동 뒤가 아니라, 행동 이전에 배치하십시오. 민감한 입력, 외부 통신, 금전, 예외 사항, 그리고 권한이 부여된 변경(privileged changes) 단계에서 중단하십시오. 신뢰할 수 있는 미리보기(preview)를 보여주고, 승인을 해당 정확한 행동에 결속시키며, 거부(reject) 및 수동 폴백(manual fallback) 기능을 보존하고, 영수증(receipt)을 유지하십시오.
검토된 출처 2026-07-29:
검토된 출처
- NIST AI RMF Core
- NIST AI RMF Playbook
- OECD AI Principle: Human-centred values and fairness
- OWASP AI Agent Security Cheat Sheet
- OWASP: HITL Dialog Forging
이러한 출처들은 정의된 감독 역할(oversight roles), 상황에 적합한 인간의 주체성(human agency), 중대한 행동에 대한 승인(approval for consequential actions), 미리 보기(previews), 감사 추적(audit trails) 및 기만적인 승인 인터페이스의 위험성을 뒷받침합니다. 하지만 이 다섯 가지 게이트를 검증하거나 안전한 결과를 보장하지는 않습니다.
요약: 루프 내 인간(human in the loop)은 실제 중단 지점이 필요합니다. 신뢰할 수 있는 상태에서 정확한 행동을 보여주고, 거부를 허용하며, 승인을 하나의 미리 보기와 연결해야 합니다.
유용한 아티팩트는 승인 영수증(approval receipt)과 예외 로그(exception log)이며, 단순히 승인 버튼의 존재가 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기