OPA와 ML-BOM을 활용한 K8s-Native AI 거버넌스 플랫폼 구축
요약
Project-Aegis는 Kubernetes 환경에서 AI/ML 워크로드를 실시간으로 탐지하고 관리하는 오픈 소스 거버넌스 플랫폼입니다. OPA와 ML-BOM을 활용하여 섀도 AI를 방지하고 보안 정책을 자동화합니다.
핵심 포인트
- Kubernetes 네이티브 방식으로 AI 워크로드 가시성 확보
- ML-BOM을 통한 AI 모델 자동 탐지 및 추적
- OPA(Open Policy Agent)를 활용한 실시간 정책 강제
- OpenA2A 스캐닝을 통한 AI 취약점 사전 탐지
Kubernetes (K8s) 상의 AI 워크로드(workloads)가 폭발적으로 증가하고 있습니다. 하지만 거버넌스(governance)는? 엉망진창입니다.
프로덕션 환경에서 모델이 실행되고 있고, 우리가 알지 못하는 섀도 AI(shadow AI) 워크로드가 존재하며, 누가 무엇을 배포했는지에 대한 가시성(visibility)이 전혀 없습니다. 컴플라이언스(compliance) 팀은 패닉에 빠져 있고, 보안 팀은 업무 과부하에 시달리고 있습니다.
그것이 제가 Project-Aegis를 구축한 이유입니다.
🎯 Project-Aegis는 AI/ML 워크로드에 대해 실시간으로 탐지, 스캔 및 정책을 강제하는 오픈 소스 Kubernetes-native AI 거버넌스 플랫폼입니다.
🔗 GitHub: github.com/Hyelzor/Project-Aegis
🔥 문제점: AI 거버넌스는 망가져 있습니다
제가 계속해서 마주쳤던 문제들은 다음과 같습니다:
· 섀도 AI (Shadow AI) — 아무도 모르게 배포된 모델들
· 감사 추적(audit trail) 부재 — 누가, 무엇을, 언제 배포했는가?
· 수동 정책 강제 (Manual policy enforcement) — 50개 이상의 클러스터에 일관된 규칙을 적용하는 것은 매우 어렵습니다.
· 컴플라이언스 악몽 — 금융, 의료 및 규제 산업은 약속이 아닌 증거를 필요로 합니다.
대부분의 기존 솔루션은 다음과 같습니다:
· 클라우드 특정적 (Cloud-specific) (종속성 발생)
· 너무 무거움 (enterprise bloat)
· Kubernetes-native 워크플로우를 위해 설계되지 않음
저는 Helm으로 즉시 작동하고, 정책을 위해 OPA와 통합되며, 조작 방지 기능이 있는 감사 로그(audit logs)를 즉시 제공하는 무언가를 원했습니다.
그래서 직접 만들었습니다.
🏗️ 아키텍처 개요
Project-Aegis가 작동하는 방식은 다음과 같습니다:
┌─────────────────────────────────────────────────────────────┐
│ Kubernetes Cluster │
│ ┌─────────────┐ ┌─────────────┐ ┌─────────────────────┐ │
...
기술 스택 (Tech stack):
· 백엔드 (Backend): Python 3.11 + FastAPI + SQLAlchemy
· 데이터베이스 (Database): PostgreSQL 16
· 정책 엔진 (Policy Engine): OPA Rego
· 프론트엔드 (Frontend): React 18 + Vite + Tailwind + Recharts
· 오케스트레이션 (Orchestration): Kubernetes + Helm
· 에이전트 SDK (Agent SDK): TypeScript 5.x + LangChain wrapper
🧠 주요 기능
1️⃣ ML-BOM 탐지 및 수집 (Discovery & Ingestion)
Kubernetes 컨트롤러 (k8s-aibom)가 클러스터에 배포된 AI 모델을 자동으로 탐지하고 ML-BOM (Machine Learning Bill of Materials) 문서를 생성합니다.
모든 모델이 추적됩니다 — 더 이상의 Shadow AI(그림자 AI)는 없습니다.
2️⃣ OpenA2A 취약점 스캐닝 (Vulnerability Scanning)
모든 유효한 ML-BOM은 웹훅 (Webhook)을 통해 자동화된 OpenA2A 스캔을 트리거합니다. 취약점은 프로덕션 (Production) 환경에 도달하기 전에 탐지됩니다.
3️⃣ 실시간 OPA 정책 강제 (Real-Time OPA Policy Enforcement)
정책은 Rego 언어로 작성되며 실시간으로 강제됩니다:
# 예시: vLLM 배포 차단
deny[msg] {
input.kind == "Deployment"
...
정책 엔진은 세 가지 액션 (Action)을 지원합니다:
· Block (차단) — 워크로드 (Workload) 실행 방지
· Allow (허용) — 워크로드 허용
· Mask (마스킹) — 로그에서 민감한 데이터 삭제
4️⃣ 변조 방지 감사 로그 (Tamper-Evident Audit Logs)
이것은 제가 가장 좋아하는 기능 중 하나입니다. 모든 감사 로그 (Audit log) 항목은 HMAC-SHA256을 사용하여 체인 형태로 해싱(Hashing)됩니다:
Log 1 → Hash(Log 1 + Secret)
Log 2 → Hash(Log 2 + Hash(Log 1 + Secret))
Log 3 → Hash(Log 3 + Hash(Log 2 + ...))
누군가 로그 항목을 수정하면 체인이 깨지며, 이를 증명할 수 있습니다. 금융, 의료 및 규제 산업에서 매우 중요합니다.
5️⃣ React 대시보드 (React Dashboard)
깔끔한 실시간 대시보드에서 다음을 확인할 수 있습니다:
· 클러스터 (Cluster) 전반의 모든 ML-BOM
· 정책 위반 사항
· 감사 추적 (Audit trail)
· 스캔 결과
🚀 5분 만에 시작하기
옵션 1: Docker Compose (로컬 개발)
git clone https://github.com/Hyelzor/Project-Aegis.git
cd Project-Aegis
make docker-up
옵션 2: Helm Chart (Kubernetes)
helm repo add aegis https://hyelzor.github.io/Project-Aegis
helm install aegis aegis/aegis
끝입니다. 대시보드는 http://localhost:3000에서 확인할 수 있습니다.
📊 실제 사례 검증
최근 사용자들이 스테이징 (Staging) 클러스터에서 Aegis를 테스트했습니다. Shadow AI 탐지 기능이 실행 중인지조차 몰랐던 두 개의 고립된 워크로드 (Orphaned workloads)를 잡아냈습니다.
한 사용자는 다음과 같이 말했습니다:
"Helm install은 놀라울 정도로 간편했고, OPA 정책은 설정한 대로 즉시 제 테스트 워크로드를 차단하기 시작했습니다. 더 많은 k8s 도구들이 기본적으로 이렇게 깔끔한 감사 추적 기능을 갖추고 있으면 좋겠습니다."
또 다른 사용자는 다음과 같이 덧붙였습니다:
"Shadow AI 탐지 기능 덕분에 우리 스테이징 클러스터에서 실행 중인지조차 몰랐던 고립된 워크로드(orphaned workloads) 두 개를 찾아냈습니다. 안심이 되면서도 한편으로는 약간 무섭기도 하더군요."
🔮 다음 단계는?
이 플랫폼은 프로덕션 환경에 적용할 준비가 되었지만, 제가 구상 중인 다음 단계는 다음과 같습니다:
· 더 많은 정책 템플릿 — 일반적인 AI 프레임워크를 위한 사전 구축된 Rego 규칙
· Slack/이메일 알림 — 정책 위반에 대한 실시간 알림
· 멀티 클러스터 지원 — 100개 이상의 클러스터에 걸친 중앙 집중식 거버넌스
· CNCF Sandbox — 궁극적으로 이 프로젝트를 CNCF에 기부하고 싶습니다
💬 함께 이야기해요
다음 사항들에 대해 여러분의 피드백을 듣고 싶습니다:
- OPA Rego 정책 — 충분히 포괄적인가요?
- HMAC 감사 체인 (audit chain) — 제가 놓친 예외 케이스(edge cases)가 있을까요?
- ML-BOM 탐지 — 다음에 어떤 모델이나 프레임워크를 지원해야 할까요?
아래에 댓글을 남기거나 GitHub에서 이슈(issue)를 생성해 주세요.
🔗 GitHub: github.com/Hyelzor/Project-Aegis
⭐ 유용하다고 생각되시면 Star를 눌러주세요!
Kubernetes 및 AI 커뮤니티를 위해 ❤️를 담아 만들었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기