
TracePilot: OpenTelemetry와 SigNoz를 사용하여 AI 에이전트 실행을 실행 가능한 통찰력으로 전환하기
요약
AI 에이전트의 복잡한 실행 과정을 시각화하고 모니터링할 수 있는 TracePilot 프로젝트를 소개합니다. OpenTelemetry와 SigNoz를 활용하여 분산된 로그와 트레이스를 대화형 대시보드로 통합합니다.
핵심 포인트
- AI 에이전트 디버깅의 어려움을 해결하기 위한 실행 인텔리전스 도구
- OpenTelemetry 및 SigNoz 기반의 텔레메트리 데이터 시각화
- 실시간 메트릭 확인 및 실행 흐름의 시각적 재생 기능 제공
- Next.js를 사용하여 구축된 대화형 모니터링 대시보드
TracePilot 구축하기
- AI 에이전트(AI agents)는 매일 더 강력해지고 있지만, 이들이 어떻게 결정을 내리는지 이해하는 것은 여전히 어렵습니다.
- AI 워크플로(workflow)가 실패할 때, 개발자들은 보통 근본 원인을 식별하기 위해 로그(logs), 트레이스(traces), 대시보드(dashboards), 모니터링 도구(monitoring tools) 사이를 전환하며 작업합니다. 이 과정은 느리고 좌절감을 줍니다.
- 저는 AI 실행을 더 쉽게 이해할 수 있게 만드는 무언가를 만들고 싶었습니다.
- 그것이 제가 실행 텔레메트리(execution telemetry)를 대화형 시각화로 변환하는 AI 기반 실행 인텔리전스 대시보드인 "TracePilot"을 구축한 이유입니다.
- 이 프로젝트는 Next.js를 사용하여 구축되었으며 SigNoz 및 OpenTelemetry와 함께 작동하도록 설계되었습니다.

("실시간 실행 메트릭(metrics), 재생 컨트롤 및 스팬(span) 세부 정보를 보여주는 TracePilot 대시보드.")
문제점
- 실행 정보가 여러 곳에 분산되어 있기 때문에 AI 시스템을 디버깅(debugging)하는 것은 매우 어렵습니다.
- 몇 가지 일반적인 문제는 다음과 같습니다:
- 수천 개의 로그 (logs)
- 복잡한 실행 흐름 (execution flows)
- 느린 근본 원인 분석 (root cause analysis)
- 어려운 트레이스 검사 (trace inspection)
- 시각적인 실행 재생 (visual execution replay) 기능 부재
- 개발자들은 구축하는 시간보다 디버깅하는 데 더 많은 시간을 소비합니다.

( " 주요 메트릭(metrics)을 사용하여 실행 상태를 즉시 강조하는 대시보드.)"
- 단일 실행에는 다음과 같은 과정이 포함될 수 있습니다:
사용자 프롬프트 (User Prompt)
│
▼
플래너 (Planner)
│
▼
메모리 (Memory)
│
▼
도구/API (Tool/API)
│
▼
LLM
│
▼
최종 응답 (Final Response)
나의 솔루션
- TracePilot은 개발자가 AI 실행 과정을 실시간으로 모니터링할 수 있는 단일 대시보드를 제공합니다.
- 개발자는 가공되지 않은 로그 (raw logs)를 읽는 대신, 실행 과정을 시각적으로 검사할 수 있습니다.
- 이 플랫폼은 다음 사항에 집중합니다:
-
- 실행 재생 (Execution replay)
-
- 성능 지표 (Performance metrics)
-
- 실패 분석 (Failure analysis)
-
- 스팬 검사 (Span inspection)
-
- 향후 SigNoz 통합 예정.
TracePilot 소개
TracePilot은 AI 워크플로우를 더 쉽게 이해할 수 있도록 설계된 대화형 AI 실행 탐색기 (Interactive AI Execution Explorer)입니다.
TracePilot은 텔레메트리 (telemetry)를 고립된 트레이스 (traces)와 로그 (logs)로 취급하는 대신, 하나의 실행을 연결된 워크플로우로 제시합니다.
목표는 간단합니다:
개발자가 텔레메트리에서 이해로 나아갈 수 있도록 돕는 것입니다.
현재 MVP는 실행 데이터를 시각화하고 개발자 경험 (developer experience)을 입증하는 데 집중하고 있습니다. 인터페이스를 보여주기 위해 샘플 실행 데이터를 사용하며, 장기적인 목표는 SigNoz에 의해 수집되는 라이브 OpenTelemetry 트레이스와 직접 통합하는 것입니다.
아키텍처 (Architecture)
TracePilot의 상위 수준 아키텍처는 표준 관측성 (observability) 도구와 함께 작동하도록 설계되었습니다.
사용자 (User)
│
▼
AI 에이전트 (AI Agent)
│
▼
OpenTelemetry SDK
│
▼
OTLP Exporter
│
▼
SigNoz
│
▼
TracePilot 대시보드 (TracePilot Dashboard)
│
▼
실행 인텔리전스 (Execution Intelligence)
이 프로토타입에서 대시보드는 모의 실행 데이터 (mock execution data)를 사용하여 의도된 사용자 경험을 보여줍니다. 다음 단계는 이러한 시각화 자료를 라이브 텔레메트리에 연결하는 것입니다.
기술 스택 (Technology Stack)
| 계층 (Layer) | 기술 (Technology) |
|---|---|
| 프론트엔드 (Frontend) | Next.js |
| 언어 (Language) | TypeScript |
| 스타일링 (Styling) | Tailwind CSS |
| 워크플로우 시각화 (Workflow Visualization) | React Flow |
| 애니메이션 (Animations) | Framer Motion |
| 아이콘 (Icons) | Lucide React |
| 관측성 (Observability) | OpenTelemetry (통합 계획 중) |
| 모니터링 (Monitoring) | SigNoz (통합 계획 중) |
🔄 대화형 실행 그래프 (Interactive Execution Graph)
TracePilot의 핵심 아이디어 중 하나는 AI 워크플로우를 대화형 그래프 (interactive graph)로 표현하는 것입니다.
개발자는 수십 개의 스팬 (spans)을 개별적으로 읽는 대신, 전체 실행 경로를 시각적으로 따라갈 수 있습니다.
User Prompt
│
▼
Planner
│
▼
Memory
│
▼
Flight Search API
│
▼
LLM
│
▼
Response
각 노드는 워크플로 (workflow)의 한 단계를 나타냅니다.
🔍 스팬 (Span) 상세 정보
실행 단계 중 하나를 클릭하면 다음과 같은 추가 정보가 표시됩니다:
- 상태 (Status)
- 지속 시간 (Duration)
- 재시도 (Retries)
- 토큰 사용량 (Token usage)
- 트레이스 식별자 (Trace identifier)
이를 통해 개발자는 대시보드를 벗어나지 않고도 각 단계를 조사할 수 있습니다.
▶️ 실행 재생 (Execution Replay)
실행 순서를 이해하는 것은 실행 세부 정보를 이해하는 것만큼이나 중요합니다.
재생 모드는 각 단계를 순차적으로 훑어주어 워크플로를 더 쉽게 따라갈 수 있게 합니다.
이 개념은 여러 도구를 사용하는 장시간 실행되는 AI 에이전트 (AI agents)의 경우 특히 가치 있을 수 있습니다.
🤖 AI 조사 (프로토타입)
TracePilot에서 탐구한 또 다른 아이디어는 AI 지원 조사 (AI-assisted investigation)입니다.
개발자가 텔레메트리 (telemetry)를 수동으로 해석하도록 요구하는 대신, 인터페이스가 다음과 같이 요약할 수 있습니다:
가능한 근본 원인 (Possible root cause)
뒷받침하는 증거 (Supporting evidence)
권장 사항 (Recommendations)
예를 들어:
- 근본 원인 (Root Cause)
- Flight Search API 시간 초과 (timed out).
- 증거 (Evidence)
- 실행 지속 시간이 예상 지연 시간 (latency)을 초과함.
- 권장 사항 (Recommendation)
- 시간 초과 (timeout) 시간 늘리기.
- 재시도 전략 (retry strategy) 활성화.
- API 응답 시간 조사.
- 현재 구현은 예시 데이터를 사용하여 사용자 경험을 보여줍니다.
개발 여정
이 프로젝트에서 특히 흥미로웠던 측면 중 하나는 프로토타이핑 과정에서 AI 지원 개발 도구를 사용한 것이었습니다.
이 도구들은 반복적인 UI 작업을 가속화하는 데 도움을 주어, 모든 컴포넌트를 처음부터 작성하기보다 제품 컨셉, 사용자 경험, 그리고 관측성 (observability) 워크플로에 더 집중할 수 있게 해주었습니다.
덕분에 다양한 아이디어를 탐색하면서 빠르게 반복 (iterate)하는 것이 더 쉬워졌습니다.
도전 과제
프로토타입을 구축하는 것만으로도 몇 가지 흥미로운 질문이 제기되었습니다:
- 복잡한 AI 워크플로우 (workflows)를 어떻게 시각화해야 할까요?
- 디버깅 (debugging) 중에 가장 중요한 정보는 무엇일까요?
- 개발자에게 과도한 부담을 주지 않으면서 관측성 (observability) 데이터를 어떻게 제시할 수 있을까요?
- 다단계 AI 에이전트 (multi-step AI agents)를 위한 실행 재생 (execution replay)은 어떻게 작동해야 할까요?
인터페이스를 설계할 때는 기술적 세부 사항과 사용성 (usability) 사이의 균형을 맞추는 것이 필요했습니다.
향후 개선 사항 (Future Improvements)
제가 탐구하고 싶은 몇 가지 방향이 있습니다:
- 실시간 OpenTelemetry 통합
- 직접적인 SigNoz 트레이스 (trace) 연결
- 실제 텔레메트리 (telemetry)를 활용한 AI 생성 근본 원인 분석 (root cause analysis)
- 여러 실행 간의 실행 비교
- 토큰 사용량 분석 (Token usage analytics)
- 비용 추정 (Cost estimation)
- 성능 회귀 (Performance regression) 탐지
- 멀티 에이전트 (Multi-agent) 워크플로우 시각화
- 배운 점
TracePilot 작업을 통해 중요한 아이디어를 강화할 수 있었습니다:
- 텔레메트리 (telemetry)를 수집하는 것은 첫 번째 단계일 뿐입니다.
- 개발자들에게는 해당 텔레메트리를 빠르게 해석할 수 있도록 돕는 인터페이스도 필요합니다.
- 실행을 워크플로우 (workflow)로 시각화하는 것은 로그 (logs)와 트레이스 (traces)로부터 수동으로 재구성하는 것보다 훨씬 더 직관적으로 느껴집니다.
결론 (Conclusion)
AI 에이전트는 점점 더 복잡해지고 있으며, 그들의 동작을 이해하는 것은 빠르게 관측성 (observability)의 과제가 되고 있습니다.
TracePilot은 간단한 아이디어를 탐구합니다:
개발자에게 가공되지 않은 텔레메트리 (raw telemetry)로부터 실행 과정을 재구성하도록 요청하는 대신, 실행 과정을 상호작용이 가능한 시각적 이야기로 제시하는 것입니다.
이 프로젝트는 여전히 진화 중이지만, 프로토타입을 구축함으로써 관측성 도구가 AI 시스템을 어떻게 지원할 수 있는지에 대해 다르게 생각할 수 있었습니다.
다음 마일스톤은 TracePilot을 실시간 OpenTelemetry 트레이스 (traces) 및 SigNoz와 통합하여, 이 프로토타입을 완전히 기능적인 실행 인텔리전스 (execution intelligence) 플랫폼으로 전환하는 것입니다.
감사합니다
이번 해커톤을 조직하고 개발자들이 현대적인 AI 관측성 (AI observability)을 실험하도록 장려해 주신 WeMakeDevs와 SigNoz 팀에 감사드립니다. TracePilot을 구축한 것은 개발자 경험 (developer experience)과 관측성 (observability)이 새로운 방식으로 어떻게 결합될 수 있는지 탐구할 수 있는 훌륭한 기회였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기