AI 에이전트 실행 추적: 분산 시스템에서의 관측 가능성 및 증거
요약
본 논문은 AI 에이전트의 실행 추적 및 관측 가능성 문제를 다루며, 현재 생태계가 통일된 의미론을 갖추지 못했음을 지적합니다. 핵심적으로 '실행 관찰(trace)', '결과 판단(evaluation)', 그리고 '관리되는 증거(auditable evidence)' 세 가지 기능이 보완적으로 작동해야 함을 제안합니다.
핵심 포인트
- AI 에이전트의 실행 추적만으로는 결과의 정확성을 입증할 수 없습니다.
- 관측 가능성 확보를 위해 추적, 평가, 그리고 관리되는 증거가 필수적으로 결합되어야 합니다.
- 분산 엣지 환경에서 AI 에이전트를 위한 새로운 거버넌스 및 감사 프레임워크(SGAEIA)가 필요합니다.
Technical edition of the same scholarly work. The content remains under author review; DOI and external URLs are pending.
목차
- 초록 (Abstract)
-
- 서론 (Introduction)
-
- 기초: 트레이스(trace), 스팬(span), 세션(session)
-
- 관측 가능성 질문 및 신호 (Observability questions and their signals)
-
- 방법, 출처 및 한계 (Method, sources, and limitations)
-
- 개방 표준: OpenTelemetry GenAI
-
- 벤더 플랫폼 (Vendor platforms)
-
- 독립 플랫폼 (Independent platforms)
-
- 비교 분석 (Comparative analysis)
-
- 논의: 격차, 위험 및 엔지니어링 관행 (Discussion: gaps, risks, and engineering practices)
-
- 분산 엣지 환경에서의 SGAEIA에 대한 개념적 함의 (Conceptual implications for SGAEIA in distributed edge environments)
-
- 결론 (Conclusion)
- 용어집 (Glossary)
- 참고 문헌 / 참고 자료 (Bibliography / References)
- 저자 소개 (About the Author)
- 연구 및 프로젝트 자료 (Research & Project Resources)
- 그림 (Figures)
- 라이선스 (License)
- 시리즈 연속성 (Series continuity)
- 추천 인용 (Suggested citation)
엣지에서 자율 에이전트를 관리하기 위한 관측 가능성, 평가 및 증거
SGAEIA 연구 시리즈 — 논문 18호
Aridio Silva
독립 연구원 (Independent Researcher)
SGAEIA — Secure Governed Autonomous Edge Intelligence Architecture의 창시자
ORCID: 0009-0008-2411-6995
저작권: © 2026 Aridio Silva | 라이선스: CC BY 4.0
초록 (Abstract)
2026년 10월 기준으로 주요 AI 에이전트 플랫폼들은 실행의 개별 단계를 기록할 수 있지만, 생태계는 여전히 안정적이고 통일된 의미론(semantics)을 갖추지 못하고 있습니다. 본 논문은 세 가지 기여를 결합합니다: 에이전트 관측 가능성 질문에 대한 개념적 프레임워크; 2026년 10월 10일에 패키지 버전이 확인된 13개 플랫폼의 비교 검토; 그리고 분산 다중 에이전트 및 엣지 환경에서 SGAEIA(Secure Governance and Auditable Evidence for AI Agents)에 대한 비규범적 해석입니다. 그 결과는 추적(trace)이 실행 경로를 재구성할 수는 있지만, 결과의 정확성을 입증하지 못하며; 필수적인 기능들이 여전히 베타(beta), 프리뷰(preview) 또는 개발(Development) 상태로 남아있고 있으며; 상이한 콘텐츠 캡처 기본값(defaults)이 직접적인 개인 정보 보호, 거버넌스 및 증거 연속성 위험을 초래한다는 것을 보여줍니다. 핵심 결론은 추적, 평가, 그리고 관리되는 증거가 보완적인 기능으로 작동해야 한다는 것입니다: 실행 관찰, 결과 판단, 그리고 감사와 보증을 위한 검증 가능한 기반 유지입니다.
키워드: AI; AI 에이전트; 관측 가능성(observability); 분산 추적(distributed tracing); OpenTelemetry; 스팬(spans); 에이전트 평가(agent evaluation); 다중 에이전트 시스템(multi-agent systems); 엣지 AI(edge AI); SGAEIA.
1. 서론
AI 에이전트가 활성화될 때, 운영자들은 그것이 실제로 무엇을 했는지 알아야 합니다: 실행이 정상적으로 종료되었는지, 오류나 편차가 어디에서 발생했는지, 얼마나 오래 걸렸고 비용이 얼마나 들었는지, 어떤 도구들이 호출되었는지, 그리고 어떤 에이전트들이 제어권을 받았는지를 말입니다. 에이전트들은 런타임(runtime)에 도구를 선택하고 위임 경로를 결정하기 때문에, 그들의 행동은 비결정적(non-deterministic)이며 평평한 애플리케이션 로그만으로는 신뢰성 있게 재구성할 수 없습니다. 따라서 엔지니어링 관행은 마이크로서비스 시스템에서 에이전트 생명 주기(agent lifecycle)로 분산 추적을 적용하고 있습니다.
본 논문은 네 가지 연구 질문에 답합니다:
- RQ1. 트레이스(traces)와 스팬(spans)은 하나 이상의 AI 에이전트 실행에 어떻게 적용되나요?
- RQ2. 완료, 오류, 편차, 지속 시간, 비용 및 실행된 단계에 대한 질문에 어떤 신호가 답을 제공하나요?
- RQ3. 이러한 기능을 어떤 플랫폼들이 어느 정도의 성숙도와 어떤 강점 및 한계로 제공하나요?
- RQ4. SGAEIA의 개념적 관점에서 트레이싱(tracing), 평가(evaluation), 증거 보존은 분산된 엣지 에이전트 거버넌스와 어떻게 관련되나요?
범위는 Anthropic, OpenAI, Google, Microsoft, AWS의 에이전트 런타임을 다루며, 일곱 개의 독립적인 관측 가능성(observability) 플랫폼과 OpenTelemetry 표준을 포함합니다. 언어 모델 자체만으로는 이러한 운영 기록을 생성하지 않습니다. 트레이싱은 실행 계층—모델 주변의 SDK, 프레임워크, 오케스트레이션 환경 또는 호스팅 플랫폼—에 의해 생성됩니다.
2. 기초: 스팬(span), 트레이스(trace), 세션(session)
**스팬(span)**은 추적된 작업의 기본 단위입니다. 각 관련 작업은 자체 스팬을 생성할 수 있으며, 일반적으로 시작 및 종료 시간, 부모 관계, 상태 및 작업별 속성을 포함합니다. 일반적인 예로는 모델 호출, 도구 호출(tool invocation), 그리고 핸드오프 또는 중첩 에이전트 호출이 있습니다. **트레이스(trace)**는 인과적으로 관련된 스팬들을 하나의 작업의 종단 간 여정으로 그룹화하며, 세션(session) 또는 스레드는 동일한 대화나 더 오래 실행되는 작업을 속하는 여러 트레이스를 그룹화할 수 있습니다.
OpenAI Agents SDK에서는 스팬이 started_at, ended_at, parent_id와 같은 필드와 단계별 데이터를 노출합니다 [R4]. AWS AgentCore도 유사하게 상태 및 이벤트를 기록합니다 [R15]. 어휘가 완전히 통일되어 있지는 않습니다. 한 플랫폼은 트레이스를 완전한 작업으로 정의할 수 있고, 다른 플랫폼은 하나의 요청-응답 사이클로 정의할 수 있으며, 세 번째는 더 긴 경계를 제공하기 위해 세션을 사용할 수 있습니다.
2.1 트레이스 해석을 변화시키는 세 가지 미묘한 차이점
첫째, 트레이스(trace)가 항상 전체 작업을 의미하는 것은 아닙니다. OpenAI는 group_id [R4]를 통해 여러 실행을 연결할 수 있는 반면, AgentCore는 트레이스를 요청-응답 주기(request-response cycle)로 간주하고 트레이스를 세션(session)으로 그룹화합니다 [R15]. 따라서 검토자는 기간, 비용 또는 완료 여부를 비교하기 전에 플랫폼의 실행 경계(execution boundary)를 식별해야 합니다.
둘째, 핸드오프(handoff)가 항상 전용 스팬(span)으로 표현되는 것은 아닙니다. OpenAI는 핸드오프 스팬을 정의하며 [R4], OpenTelemetry는 create_agent, invoke_agent, 그리고 execute_tool을 정의하여 서브 에이전트가 중첩된 invoke_agent 작업으로 나타나게 합니다 [R18, R19]. Microsoft 또한 에이전트 간 통신에 대한 의미론(semantics)을 문서화했습니다 [R11, R44].
셋째, 에이전트 트레이스는 모델, 도구, 핸드오프 스팬보다 더 많은 것을 포함할 수 있습니다. 가드레일 검사(Guardrail checks), 턴(turns), 권한 결정(permission decisions), 그리고 인간 승인을 기다리는 데 소요된 시간 등이 관측 가능한 작업이 될 수 있습니다. 예를 들어, Claude Agent SDK는 사용자 승인을 기다리는 도구에 대한 자식 스팬을 기록할 수 있습니다 [R1].
2.2 트리 구조 (Tree structure)
스팬은 평평한 목록(flat list)이라기보다는 트리를 형성합니다. 그림 1은 세션에서 모델 호출, 도구, 서브 에이전트를 포함하는 중첩 스팬을 거쳐 트레이스로 전환되는 것을 나타냅니다. 이 계층 구조는 실행 과정을 단순화된 메시지 스트림으로 축소하지 않으면서 지연 시간 분석(latency analysis), 인과 관계 재구성(causal reconstruction), 그리고 실패 위치 특정(failure localization)을 지원합니다.

그림 1 — 세션에서 검증 가능한 스팬으로. 하나의 세션은 여러 트레이스를 그룹화할 수 있으며, 각 트레이스는 에이전트, 모델, 도구, 핸드오프 스팬을 인과 구조로 정리합니다. © 2026 Aridio Silva | Project SGAEIA | CC BY 4.0.
3. 관측 가능성 질문 및 그 신호 (Observability questions and their signals)
주요 분석적 구분은 기술적 완료(technical completion)와 실질적 성공(substantive success) 사이의 차이입니다. 실행은 예외 없이 종료될 수 있지만, 여전히 부정확한 답변을 생성하거나, 지침을 위반하거나, 의도된 범위를 벗어난 행동을 할 수 있습니다. 트레이스(trace)는 운영상의 사실만을 보고합니다. 결과를 판단하기 위해서는 별도의 평가자(evaluator), 테스트, 스키마 검증기(schema validator) 또는 인간의 검토가 필요합니다.
| 질문 | 확인할 신호 | 해석 한계 |
|---|---|---|
| 작업이 완료되었는가? | 최종 실행 상태와 독립적인 결과 유효성 검사 | 예외가 없다는 것은 단지 실행이 충돌하지 않았음을 증명할 뿐이다 |
| ... |
3.1 완료 및 결과 품질
Claude Agent SDK의 결과는 종료 서브타입(termination subtype), 오류 상태(error state), 턴 수(number of turns), 지속 시간(duration) 및 비용을 보고할 수 있으며, 성공(success), 최대 턴 종료(maximum-turn termination), 실행 오류(execution error)와 같은 결과도 포함합니다 [R36]. 이러한 필드는 실행이 어떻게 중단되었는지를 설명할 뿐이며, 요청된 목표가 달성되었다는 것을 확립하지 않습니다. 따라서 의미론적 실패(Semantic failures)는 일반적인 오류 상태에 의해 여전히 보이지 않을 수 있습니다 [R37]. OpenAI의 트레이스 채점(trace grading)은 대규모로 트레이스와 결과를 평가하는 상호보완적인 접근 방식을 보여줍니다 [R5].
3.2 오류, 편차 및 감사 가능성
오류는 스팬 상태(span status), API 오류 이벤트(API error events), 그리고 실패한 도구 결과(failed tool results)에서 나타납니다. 편차(Deviations)에는 더 광범위한 증거가 필요합니다: 권한 이벤트(permission events), 가드레일 결정(guardrail decisions), 예상 경로 비교(expected-path comparison), 그리고 결과 상태에 대한 독립적인 관찰입니다. Claude Code의 권한 결정은 최종 사용자와 연관된 구조화된 이벤트로 내보낼 수 있으며, 감사(audit) 또는 SIEM 워크플로우에 입력으로 제공됩니다 [R2].
4. 방법론, 출처 및 한계점
본 검토는 2026년 10월 10일에 수행되었으며, 세 가지 출처 범주를 사용했습니다: PyPI 및 npm의 패키지 레지스트리 데이터 [R40]; 공식 공급업체 및 플랫폼 문서; 그리고 공식 문서에서 관련 내용을 다루지 않은 경우에만 보조적인 기술 자료입니다. 보조적이고 경쟁사가 생산한 비교 내용은 식별되었으며 신중하게 다루었습니다. 패키지 버전은 컨설팅 날짜에 레지스트리에서 보이는 안정화된 릴리스를 참조합니다.
비교 매트릭스에서 **✔**는 검토된 문서에서 확인된 기능, **◐**는 부분적 또는 조건부 지원을 의미하며, **—**는 해당 기능이 검토 자료에서 발견되지 않았음을 의미합니다. 매트릭스에 없는 것이 곧 그 기능이 존재하지 않는다는 증거는 아닙니다. SaaS 플랫폼은 단일 플랫폼 버전을 가지고 있지 않으므로, 버전 열에는 적용 가능한 경우 관련 SDK가 보고됩니다.
이는 체계적 검토(systematic review)나 실험적 벤치마크가 아닌 구조화된 비교 검토입니다. 본 작업은 계측 오버헤드(instrumentation overhead)를 측정하거나, 공급업체 평가를 재현하거나, 프로덕션 효과성을 확립하지 않습니다. 플랫폼의 동작 방식, 가격, 유지 정책, 성숙도 라벨 등은 명시된 날짜 이후에 변경될 수 있으므로, 도입 결정 시에는 관련 문서를 재검증해야 합니다.
5. 개방 표준: OpenTelemetry GenAI
OpenTelemetry GenAI 의미론적 규칙(semantic conventions)은 런타임과 백엔드 전반에 걸친 공통 언어의 선도적인 후보이지만, 여전히 활발하게 개발 중입니다 [R18–R20]. 정의된 작업에는 create_agent, invoke_agent, execute_tool이 포함되며; 속성(attributes)은 에이전트 및 도구의 식별자를 다루고; 메트릭에는 에이전트 실행 시간, 도구 호출 횟수, 추론 호출 횟수 등이 포함됩니다 [R18, R19]. 개발 상태란 이름과 동작 방식이 버전 간에 여전히 변경될 수 있음을 의미합니다.
실질적인 가치는 이식성(portability)입니다. Datadog은 OpenTelemetry GenAI 1.37 이상과 호환되는 트레이스(traces)를 수용하며 [R28], MLflow는 해당 컨벤션을 가져오고 내보낼 수 있고 [R33], Google ADK는 이를 네이티브하게 구현합니다 [R7]. 하지만, 공급업체별 SDK가 독점적인 스팬 유형을 방출하거나, ADOT와 같은 배포를 요구하거나, 타사 브리지를 의존할 수 있기 때문에 이식성은 여전히 불완전합니다.
6. 공급업체 플랫폼 (Vendor platforms)
6.1 Anthropic: Claude Agent SDK, Claude Code, 및 관리형 에이전트 (Managed Agents)
Claude Agent SDK는 Claude Code를 자식 프로세스로 실행하며 상호작용, 모델 호출, 도구(tools), 토큰, 비용, 권한 결정, 그리고 중첩된 서브에이전트(nested subagents)에 대한 스팬을 내보낼 수 있습니다 [R1, R2]. 이 SDK의 주요 강점은 필수 백엔드 없이 OTLP로 내보내기 할 수 있다는 점과 읽기/쓰기 페이로드에 대해 기본적으로 비활성화된 콘텐츠 처리 방식입니다. 한계점으로는 베타 스팬 이름, 기본적으로 조용한(silent) 내보내기 실패, 그리고 훅 스팬(hook spans)을 위한 추가적인 베타 설정 등이 있습니다. 관리형 에이전트 역시 베타 API 헤더를 사용합니다 [R1, R3].
6.2 OpenAI Agents SDK
OpenAI 추적 기능은 기본적으로 활성화되어 있으며 실행(run), 작업(task), 턴(turn), 에이전트(agent), 생성(generation), 도구(tool), 가드레일(guardrail), 핸드오프(handoff), 오디오 스팬을 포함합니다 [R4]. 이 플랫폼은 group_id를 통해 트레이스를 연결하고, 트레이스 등급 지정 및 에이전트 평가를 통합합니다 [R5, R6]. 강점으로는 낮은 마찰도의 계측(low-friction instrumentation)과 풍부한 에이전트별 의미론(agent-specific semantics)을 가지고 있다는 점이며, 한계점으로는 Zero Data Retention 추적과의 비호환성, 입력 및 출력의 기본 캡처, 배치 내보내기 동작 방식, 그리고 OpenTelemetry 브리지를 위한 타사 도구 의존성이 있습니다 [R4, R26].
6.3 Google ADK 및 Vertex AI Agent Engine
Google ADK는 에이전트 실행을 루트 스팬(root span)으로, 모델 및 도구 작업을 자식 스팬(child spans)으로 포함하는 OpenTelemetry GenAI semantics를 구현합니다 [R7, R8]. Agent Engine은 추적(traces)을 Cloud Trace로 전송하고 응답 시간과 실행된 작업을 노출합니다 [R9]. 이 설계는 네이티브 OpenTelemetry 지원 및 관리형 시각화의 이점을 누리지만, Cloud Logging 크기 제한과 문서화된 통합 추적-평가 워크플로우의 부재는 여전히 중요한 제약 사항으로 남아 있습니다 [R9, R10].
6.4 Microsoft Foundry와 Agent Framework
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기