인프라 엔지니어 및 SRE가 2026년에 주목해야 할 AI 기술
요약
AI 시스템 운영 환경에서 SRE는 단순한 인프라 모니터링을 넘어 AI 품질과 태스크 성공 여부를 추적하는 방향으로 전환해야 합니다. Agent의 복잡성 증가에 따라, AWS Bedrock이나 OpenAI 같은 플랫폼은 Runtime, Observability 등을 제공하며, 개발자는 공통 레이어와 벤더별 기능을 분리하여 관리하는 것이 중요합니다.
핵심 포인트
- SRE는 'HTTP 200'을 넘어 태스크 성공 여부를 모니터링해야 합니다.
- AI 시스템에는 가용성(SLO) 외에 AI 품질 SLO (태스크 성공률 등)가 필수입니다.
- Agent의 복잡한 실행 흐름은 OpenTelemetry를 활용하여 추적하는 것이 중요합니다.
- 장시간 Agent 실행을 위해 Durable execution, 멱등성 등의 분산 시스템 원칙이 필요합니다.
요약 (Executive Summary)
AI 시스템을 프로덕션 환경에서 운영하는 SRE에게 중요한 것은 GPU만이 아닙니다.
LLM/API의 가용성(availability), Rate Limit, Token Cost, Agent의 장시간 실행, Tool의 장애, AI 품질의 회귀(Regression), 추적(Trace), 보안 경계(Security Boundary)까지 모두 운영 대상이 됩니다. 기존의 'HTTP 200이면 정상'이라는 모니터링에서 벗어나,
태스크가 올바르게 완료되었는지를 모니터링하는 운영으로 전환해야 합니다. 최종 확인일: 2026-10-08
AI 시스템에서는 인프라 장애와 AI 품질 장애가 별개로 발생할 수 있습니다.
HTTP 200
Latency 1.2 sec
Error rate 0%
...
이러한 상태가 존재할 수 있습니다.
게다가 Agent의 경우,
User
↓
Agent
...
처럼 의존하는 요소가 늘어납니다.
AWS의 Amazon Bedrock AgentCore는 프로덕션 Agent를 위해 Runtime, Gateway, Identity, Memory, Observability 등을 제공하며, 토큰 사용량, 레이턴시(latency), 세션 시간, 에러율 등을 모니터링 대상으로 제시하고 있습니다.
OpenAI 역시 Agents API에서 장시간 세션, 샌드박스, 서브 에이전트 등 기능을 제공합니다.
SRE가 Agent Runtime을 이해해야 하는 시대입니다.
여러 애플리케이션이 외부 AI API에 직접 연결할 경우,
- API Key 관리
- 모델 관리
- Rate Limit
- Cost Attribution (비용 귀속)
- Audit (감사)
- Data Policy (데이터 정책)
등이 분산됩니다.
따라서,
이라는 공통 레이어(common layer)가 유효합니다.
다만, 모든 벤더 기능을 '최소공배수 API'에 통합하면 고급 Tool Calling이나 Agent 기능을 상실할 수 있으므로,
공통: 인증 / 감사 / Cost / Routing / Redaction
Provider-specific:
...
처럼 분리하는 것이 권장됩니다.
AI 서비스에는 최소한 다음 두 가지가 필요합니다.
System SLO (서비스 수준 목표)
- availability (가용성)
- latency (지연 시간)
- error rate (에러율)
그리고
AI Quality SLO (AI 품질 수준 목표)
- task success rate (태스크 성공률)
- groundedness (근거 기반 정도)
- tool success (툴 성공)
- policy violation rate (정책 위반율)
Agent에서는 최종 답변만 저장해도 원인 분석이 불가능합니다.
최소한,
trace_id
├─ model request
├─ retrieval
...
을 추적할 수 있도록 해야 합니다.
OpenTelemetry에서는 GenAI 클라이언트, Agent, MCP 등을 대상으로 하는 Semantic Conventions가 정비되어 있습니다.
Agent 실행이 수십 초에서 수 시간으로 늘어나면,
동기(synchronous) HTTP 요청만으로는 다루기 어려워집니다.
필요한 것은 다음과 같습니다.
- Durable execution (지속적 실행)
- Retry (재시도)
- Idempotency (멱등성)
- Timeout (시간 초과)
- Cancellation (취소)
- Checkpoint (체크포인트)
- Dead Letter Queue (데드 레터 큐)
이는 LLM 고유의 문제라기보다는 분산 시스템의 기본으로 돌아가는 이야기입니다.
Agent에서는 모델 호출 횟수가 사용자 요청 수와 일치하지 않습니다.
따라서,
cost / API call
만 보는 것보다,
cost / completed task
cost / user
cost / tenant
...
을 보는 것이 더 효과적입니다.
AI 기능이 느림
|
+-- Provider latency?
...
AI에서는 '모델이 느리다'로 끝내지 않는 것이 중요합니다.
-
AI Provider별로 타임아웃을 설정했는지
-
재시도 대상과 비대상으로 분류했는지
-
Exponential Backoff (지수 백오프)를 설정했는지
-
Rate Limit을 흡수하는 메커니즘이 있는지
-
Queue / Backpressure(역압력)를 검토했는지
-
Agent를 취소할 수 있는지
-
Tool Call에 멱등성을 부여했는지
-
Provider 장애 시의 Fallback 정책이 있는지
-
request / agent / tool을 동일한 Trace에서 추적할 수 있음
-
model ID를 기록함
-
prompt version을 기록함
-
retrieval version을 기록함
-
지연 시간(latency)을 공정별로 분해함
-
토큰 사용량(token usage)을 기록함
-
작업 성공 여부(task success)를 기록함
-
테넌트 단위의 비용(Cost)을 확인할 수 있음
-
API Key를 Secrets Manager 등에서 관리함
-
Agent Sandbox로부터의 외부 통신(egress)을 제어함
-
MCP Server를 allowlist화함
-
Tool별 권한을 최소화함
-
AI Trace의 기밀 정보를 마스킹(redact)함
-
Kill Switch를 준비함
AI API의 429나 5xx에 대해 모든 Worker가 동시에 재시도(Retry)하면 장애를 악화시킵니다.
일반적인 분산 시스템과 마찬가지로,
- 지수 백오프(exponential backoff)
- 지터(jitter)
- 서킷 브레이커(circuit breaker)
- 큐(queue)
를 사용합니다.
Agent가,
Search
→ Think
→ Search
...
을 반복할 수 있습니다.
반드시,
- 최대 단계(max steps)
- 최대 토큰(max tokens)
- 최대 지속 시간(max duration)
- 최대 비용(max cost)
등의 실행 예산(Budget)을 설정합니다.
Agent Trace에는,
- 사용자 프롬프트(User Prompt)
- 사내 문서
- DB 검색 결과
- Tool 인자(引数)
- API 응답(APIレスポンス)
이 포함될 수 있습니다.
Observability Platform을 '단순한 로그 저장소'로 생각하지 않고, 기밀 데이터 스토어로서 취급합니다.
- Amazon Bedrock AgentCore
- OpenAI Agents API
- OpenAI Developers
- OpenTelemetry GenAI Semantic Conventions
- MCP Specification
- NIST AI Risk Management Framework
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기