SAFi: 추가 기능이 아닌 런타임으로서의 거버넌스
요약
SAFi는 AI 거버넌스를 모델 외부의 필터가 아닌, 에이전트의 내부 런타임 루프로 통합하는 새로운 아키텍처를 제안합니다. 모델을 중심이 아닌 추론 구성 요소로 취급하며, 가치, 지성, 의지, 양심, 정신의 5가지 능력을 통해 거버넌스가 실행 과정 자체에 녹아들게 합니다.
핵심 포인트
- 기존 거버넌스는 모델 외부의 필터나 가드레일로 작동함
- SAFi는 거버넌스를 에이전트의 내부 런타임 루프로 설계함
- 모델은 시스템의 중심이 아닌 교체 가능한 추론 구성 요소임
- 가치, 지성, 의지, 양심, 정신의 5단계 시퀀스로 작동함
SAFi와 인간 피드백 기반 강화학습 (RLHF) 같은 기술 사이의 비교는 어느 정도까지만 유용합니다. Constitutional AI는 응답을 생성하고 평가하는 과정에 명시적인 원칙을 도입하기 때문에 개념적으로 더 가까운 비교 대상입니다. 그럼에도 불구하고, 이러한 접근 방식들은 문제의 다른 계층을 다룹니다.
RLHF와 Constitutional AI는 주로 모델이 어떻게 행동하는지를 형성합니다. SAFi는 AI 에이전트가 어떻게 작동하는지를 거버넌스(governance)합니다.
이러한 차이는 중요한데, AI 에이전트는 단순히 텍스트를 생성하는 언어 모델(language model)만이 아니기 때문입니다. 에이전트는 요청을 해석하고, 가능한 응답에 대해 추론하며, 행동 여부를 결정하고, 도구(tools)를 호출하며, 정보에 접근하고, 데이터를 수정하며, 이를 배포하는 조직에 책임을 져야 하는 답변을 생성할 수 있습니다.
전통적인 아키텍처: 모델이 중심에 있는 구조
오늘날 AI 거버넌스의 상당 부분은 모델 주변에 배치된 필터(filters), 분류기(classifiers), 가드레일(guardrails), 모니터(monitors), 그리고 정책 체크(policy checks)로 구성됩니다.
일반적인 패턴은 다음과 같습니다:
- 요청이 모델에 도달합니다.
- 모델이 응답을 생성하거나 행동을 제안합니다.
- 외부 제어 장치가 입력, 출력 또는 도구 요청을 검사합니다.
- 시스템이 결과를 허용, 차단, 수정 또는 기록합니다.
이 아키텍처는 가치가 있을 수 있습니다. 외부 제어 장치는 금지된 콘텐츠를 탐지하고, 특정 행동을 제한하며, 모니터링 또는 집행을 제공할 수 있습니다. 이들은 책임감 있는 배포를 위해 종종 필요한 부분입니다.
하지만 이 아키텍처는 여전히 프로세스의 중심에 모델을 둡니다. 거버넌스는 추가적인 제어 메커니즘으로서 모델 주변에 위치합니다. 많은 시스템에서 설명과 감사를 위해 필요한 증거 또한 모델이 출력을 생성하거나 행동을 제안한 후에 수집됩니다.
이는 실행(execution)과 거버넌스(governance) 사이에 기본적인 분리를 만듭니다:
- 모델은 초안을 생성합니다.
- 거버넌스 시스템은 초안을 평가합니다.
- 모니터링 시스템은 발생한 일을 기록합니다.
제어 장치들이 효과적일 수는 있지만, 거버넌스는 여전히 주요 지능(primary intelligence)을 둘러싼 외부 활동으로 남아 있습니다.
SAFi의 아키텍처적 차이점
SAFi는 다른 접근 방식을 취합니다. SAFi는 거버넌스를 에이전트가 작동하는 내부 런타임 루프 (runtime loop)로 취급합니다.
모델은 시스템의 중심이 아닙니다. 모델은 루프가 특정 인지 기능 (cognitive functions)을 수행하기 위해 사용하는 교체 가능한 추론 구성 요소 (reasoning component), 즉 기질 (substrate)입니다.
SAFi의 시퀀스는 다섯 가지 능력 (faculties)을 중심으로 구조화되어 있습니다:
- 가치 (Values): 에이전트가 준수해야 할 사항을 정의합니다.
- 지성 (Intellect): 요청을 해석하고 응답 또는 제안된 행동을 개발합니다.
- 의지 (Will): 응답 또는 행동을 진행할지 여부를 결정합니다.
- 양심 (Conscience): 거버넌스 가치 및 정책에 따라 결정을 평가합니다.
- 정신 (Spirit): 결과를 통합하고 최종적인 거버넌스 결과 (governed outcome)를 결정합니다.
가치는 턴 (turn)이 시작되기 전에 설정됩니다. 나머지 네 가지 능력은 해당 턴 동안 그 가치들을 적용하기 위한 실질적인 추론 시퀀스 (reasoning sequence)를 제공합니다.
이는 거버넌스가 에이전트가 행동한 후에 단순히 적용되는 것이 아님을 의미합니다. 거버넌스는 에이전트의 응답과 행동이 형성되고, 평가되며, 승인되고, 기록되는 과정 그 자체입니다.
모델은 권위가 아닌 구성 요소가 됩니다
이것이 SAFi의 중심에 있는 개념적 전환입니다.
모델 중심 아키텍처 (model-centered architecture)에서는 모델을 지능의 주요 원천으로 취급합니다. 주변 시스템들은 모델의 행동을 제약, 검사 또는 수정하려고 시도합니다.
SAFi 아키텍처에서 모델은 추론 능력 (reasoning capacity)을 제공하지만, 거버넌스 가치를 정의하거나, 자신의 행동을 스스로 승인하거나, 최종적인 책임의 원천 역할을 하지는 않습니다.
조직의 헌장과 정책이 거버넌스 가치를 정의합니다. SAFi는 런타임 루프를 통해 이러한 제어 장치들을 적용합니다. 모델은 조직이 자신의 거버넌스 구조나 감사 이력 (audit history)을 모델 제공업체에 양도할 필요 없이 교체하거나 업그레이드할 수 있습니다.
이는 모델 독립성 (model independence)을 지원합니다:
모델은 변경될 수 있습니다. 하지만 거버넌스 헌장(governing charter), 정책(policies), 집행 프로세스(enforcement process), 그리고 감사 추적(audit trail)은 조직의 통제하에 유지됩니다.
이는 특정 출력을 선호하도록 모델을 학습시키는 것과는 다릅니다. 이는 어떤 모델이 추론(reasoning)을 수행하든 관계없이 에이전트(agent)를 거버넌스하기 위한 런타임 아키텍처 (runtime architecture)입니다.
전달 및 실행 전의 거버넌스
SAFi는 답변이 반환되기 전과 도구(tool)가 실행되기 전에 각 거버넌스 턴(governed turn)을 평가합니다.
이러한 구분은 에이전트형 AI (agentic AI)에서 특히 중요합니다. 응답은 생성 후에 검토될 수 있지만, 도구 호출 (tool call)은 외부적인 결과를 초래할 수 있기 때문입니다. 민감한 정보를 읽거나, 시스템에 기록하거나, 메시지를 보내거나, 레코드를 변경하거나, 또는 다른 작업을 시작할 수 있습니다.
따라서 SAFi는 거버넌스된 동작 (governed action)을 동일한 런타임 프로세스의 일부로 취급합니다. 도구 호출은 실행 전에 에이전트의 허용 목록 (allow-list)과 대조하여 확인됩니다. 읽기(reads)와 쓰기(writes)는 서로 다른 기준을 적용받을 수 있으며, 취해진 동작은 이를 승인한 결정과 함께 기록됩니다.
관련된 질문은 단지 다음과 같은 것만이 아닙니다:
“최종 답변이 수용 가능한 수준이었는가?”
또한 다음과 같은 질문도 포함됩니다:
“제안된 동작이 발생하기 전에 승인되었는가, 그리고 그 이유를 증명할 수 있는가?”
루프에 의해 생성되는 감사 가능성 (Auditability)
많은 시스템에서 감사 가능성 (auditability)은 추가적인 관측성 (observability) 기능으로 취급됩니다. 상호작용이 일어난 후 모델 주변에서 로그 (logs)가 수집되는 방식입니다.
SAFi의 감사 추적 (audit trail)은 원칙적으로 다릅니다. 루프 자체가 명시적인 결정 지점 (decision points)을 포함하고 있기 때문에, 거버넌스 턴이 진행됨에 따라 기록이 생성됩니다.
거버넌스된 기록에는 다음이 포함될 수 있습니다:
- 원본 요청 (original request)
- 모델이 생성한 초안 (model-generated draft)
- 항목별 평가 원장 (value-by-value evaluation ledger)
- 집행 결정 (enforcement decision)
- 시행 중인 정책 버전 (policy version in force)
- 도구 호출 및 동작 기록 (tool call and action record)
- 결과적인 감독 또는 검토 상태 (resulting supervisory or review state)
따라서 감사 가능성은 단순히 모델이 무엇을 말했는지에 대한 기록이 아닙니다. 그것은 거버넌스된 런타임 (governed runtime)이 해당 턴을 어떻게 처리했는지에 대한 기록입니다.
이것이 바로 "런타임 (runtime)"이 SAFi의 포지셔닝에서 핵심적인 이유입니다. 거버넌스 프로세스는 나중에 수행되는 오프라인 평가가 아닙니다. 그것은 실행 경로 (execution path)의 일부입니다.
SAFi는 단순히 또 다른 필터가 아닙니다
일반적으로 필터는 입력 또는 출력이 금지되거나 허용된 조건에 부합하는지를 묻습니다.
SAFi는 더 광범위한 질문을 던집니다:
- 어떤 조직적 가치 (organizational values)가 적용되는가?
- 어떤 정책 (policy)이 이 상황을 규정하는가?
- 어떤 응답이나 행동이 제안되었는가?
- 응답이 규정된 가치와 일치하는가?
- 해당 행동이 승인되었는가?
- 어떤 정책 버전이 효력을 발휘하고 있었는가?
- 어떤 결정이 내려졌으며, 그 이유는 무엇인가?
- 에이전트 (agent)가 시간이 지나도 자신의 헌장 (charter)과 일관성을 유지하는가?
이것이 SAFi가 정확성을 보장하거나, 환각 (hallucinations)을 방지하거나, 편향 (bias)을 제거한다는 의미는 아닙니다. 그라운딩 (Grounding), 검색 품질 (retrieval quality), 모델 행동 (model behavior), 그리고 인간의 검토 (human review)는 여전히 중요합니다.
차이점은 SAFi가 거버넌스를 별도의 검사 단계로 취급하는 대신, 이러한 질문들을 거버넌스된 실행 프로세스 (governed execution process)의 일부로 만든다는 것입니다.
더 정밀한 비교
간결한 비교는 다음과 같을 수 있습니다:
| 접근 방식 | 주요 목적 | 모델의 역할 | 거버넌스 위치 | 감사 결과 (Audit result) |
|---|---|---|---|---|
| RLHF | 선호도 기반 학습을 통해 모델 행동을 형성 | 최적화되는 학습된 시스템 | 학습 중에 내재됨 | 학습 및 평가 아티팩트 (artifacts) |
| ... | ||||
| 이러한 범주들은 서로 중복될 수 있습니다. SAFi는 모델 학습, 헌법적 원칙 (constitutional principles), 검색 (retrieval), 필터 (filters), 그리고 보안 제어 (security controls)와 함께 사용될 수 있습니다. 핵심은 한 가지 접근 방식이 다른 모든 방식의 필요성을 없앤다는 것이 아닙니다. |
핵심은 SAFi가 다른 아키텍처적 질문을 다룬다는 점입니다:
조직이 모델을 사전에 형성하거나 사후에 출력을 검사하는 것에 그치지 않고, AI 에이전트가 추론하고 행동하는 동안 어떻게 거버넌스를 수행할 것인가?
핵심적인 차이점
SAFi의 차이점은 간단하게 다음과 같이 말할 수 있습니다:
SAFi는 에이전트형 AI (agentic AI)를 위한 오픈 소스 런타임 거버넌스 엔진 (runtime governance engine)입니다. SAFi는 모델을 가치 중심 루프 (values-driven loop) 내부의 추론 기질 (reasoning substrate)로 취급하며, 응답과 도구 호출 (tool calls)이 진행되기 전에 이를 평가하고, 실행의 일부로서 감사 추적 (audit trail)을 생성합니다.
이를 통해 조직은 에이전트의 행동을 정의하는 거버넌스 가치 (governing values), 정책 (policies), 행동 권한 (action permissions) 및 기록 (records)에 대한 통제권을 갖게 됩니다.
모델은 여전히 중요하지만, 더 이상 시스템의 전체는 아닙니다. 에이전트는 명시적이고, 검사 가능하며, 모델 독립적이고, 대화뿐만 아니라 행동을 위해 설계된 조직적 거버넌스 프로세스 내에서 작동합니다.
이러한 차이점을 평가하는 가장 강력한 방법은 슬로건을 비교하는 것이 아닙니다. 저장소를 복제(Clone the repository)하고, 데모를 실행(run the demo)하며, 거버넌스가 적용된 감사 추적을 검사(inspect a governed audit trail)하고, 기록된 의사 결정 프로세스가 주장하는 바와 일치하는지 확인하십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기