AI 인프라/플랫폼 엔지니어를 위한 실용적인 로드맵
요약
본 로드맵은 DevOps, Platform, SRE 등 전통적인 인프라 엔지니어들이 AI 플랫폼 및 LLM 운영 전문가로 성장하기 위한 실질적이고 프로젝트 중심의 가이드를 제공합니다. Linux, Kubernetes, Terraform 같은 기본 기술 위에 로컬 LLMs, GPU 스케줄링, RAG 시스템, 에이전트 등을 결합하는 방법을 다룹니다.
핵심 포인트
- AI 인프라 엔지니어에게 필요한 핵심 기술 스택을 제시합니다.
- 로컬 LLM 런타임부터 GPU 기반 추론 플랫폼까지 실습 경로를 제공합니다.
- RAG 파이프라인 구축과 AI 지원 관측 가능성(AIOps) 학습에 초점을 맞춥니다.
- DevOps, SRE 등 기존 경력자가 AI 분야로 전환하기 용이한 구조입니다.
DevOps, Platform, SRE, 그리고 Cloud 엔지니어 중에서 AI 인프라 / AI 플랫폼 엔지니어가 되고자 하는 사람들을 위한 실질적이고 프로젝트 중심의 로드맵입니다.
이 저장소는 Linux, 컨테이너, Kubernetes, Terraform, CI/CD, 관측 가능성(observability), 보안과 같은 전통적인 인프라 기술을 현대 AI 플랫폼 스택인: 로컬 LLMs, GPU 스케줄링, 추론 서비스(inference serving), RAG 시스템, 에이전트(agents), MCP, 그리고 AI 안전성과 연결합니다.
- 대상 독자 (Who This Is For)
- 구축할 내용 (What You Will Build)
- 저장소 맵 (Repository Map)
- 권장 학습 경로 (Recommended Learning Paths)
- 핵심 커리큘럼 (Core Curriculum)
- 최종 프로젝트 (Capstone Projects)
- 빠른 시작 (Quick Start)
- 이 저장소에 대한 제안 개선 사항 (Suggested Improvements for This Repo)
- 기여하기 (Contributing)
이 로드맵은 이미 이 영역 중 최소한 하나를 알고 있으며 AI 플랫폼 작업으로 나아가고자 하는 학습자들을 위해 설계되었습니다:
LLM 기반 시스템을 배포하고 운영하려는 DevOps 엔지니어. AI 지원 관측 가능성, 경고 및 복구 워크플로우를 구축하려는 SRE. Kubernetes에서 GPU 백업 추론 플랫폼을 실행하려는 Platform 엔지니어. Terraform과 Kubernetes를 사용하여 AI 준비 인프라를 프로비저닝하려는 Cloud 엔지니어. RAG, 모델 서비스, 그리고 프로덕션 AI 운영을 이해하려는 Backend 엔지니어.
만약 DevOps에 처음이라면, 고급 프로젝트로 바로 뛰어들기 전에 Fundamentals 모듈과 12 Days Series부터 시작하세요.
이 저장소를 따라가면 다음을 구축하는 연습을 하게 됩니다:
- Ollama 및 llama.cpp 스타일의 워크플로우를 사용한 로컬 LLM 런타임.
- AI 워크로드를 위한 보안 Kubernetes 매니페스트.
- 벡터 데이터베이스와 로컬 추론을 이용한 RAG 파이프라인.
- AI 지원 로그 분석 및 인시던트 분류 서비스.
- 자동 스케일링 기능을 갖춘 GPU 인식 Kubernetes 추론 플랫폼.
- 인프라와 안전하게 상호 작용하는 에이전트형 DevOps 도구.
- LLM 애플리케이션을 위한 관측 가능성 및 가드레일 패턴.
| 경로 | 목적 |
|---|---|
ROADMAP.md | 인프라 기본기부터 AI 보안 및 AIOps까지 다루는 24주 단계별 로드맵. |
QUICKSTART.md | 로컬 랩을 빠르게 구축하고 빌드를 시작할 수 있는 가장 빠른 경로. |
STUDY_MATERIALS.md | 선별된 학습 자료, 공식 문서, 실습 환경(labs), 포트폴리오 아이디어 및 마일스톤. |
12-days-series/ | 핵심 DevOps + AI 기술에 대한 일일 실습 학습 순서. |
fundamentals/ | Linux, 네트워킹, Docker, Kubernetes, CI/CD, Terraform, 스토리지, Python 자동화 노트. |
prompt-engineering/ | 프롬프팅 패턴, 구조화된 출력(structured outputs), 도구 사용(tool use), 평가 개념. |
local-llms/ | 로컬 모델 런타임, 모델 포맷, 양자화(quantization), 성능 튜닝. |
kubernetes-ai/ | GPU Operator, 추론 서빙(inference serving), KServe, vLLM, KEDA, Kubernetes AI 운영. |
rag-vector-db/ | 검색 증강 생성(Retrieval-augmented generation), 임베딩, Qdrant, ChromaDB, pgvector, 벡터 검색. |
ai-agents/ | 에이전트 설계, 도구 호출(tool calling), 안전한 자동화, 다중 에이전트 워크플로우. |
mcp/ | 모델 컨텍스트 프로토콜(Model Context Protocol) 개념 및 서버 패턴. |
observability-aiops/ | OpenTelemetry, AI 트레이싱, 로그, 메트릭, 인시던트 자동화. |
ai-security/ | 프롬프트 주입(Prompt injection), 가드레일(guardrails), 시크릿(secrets), 네트워크 정책, LLM 보안 위험. |
projects/ | 포트폴리오 수준의 최종 프로젝트 및 실행 가능한 예제. |
diagrams/ | Mermaid 아키텍처 다이어그램 및 렌더링 지침. |
- 읽기
QUICKSTART.md
. - 완료
12-days-series/day01-linux-containers
. - 12-days-series/에서 Kubernetes 및 Python 자동화 일자 완료하기
. - 읽기
local-llms/
그리고 로컬 모델 하나 실행해 보기. - AI DevOps Copilot 프로젝트 구축하기.
- 검토
fundamentals/kubernetes-basics.md및fundamentals/terraform.md
. - 학습
kubernetes-ai/ 및 local-llms/
. - Local RAG Assistant 구축하기
. - Kubernetes AI Platform 배포하기
. - observability-aiops/에서 관측 가능성(observability) 추가하기
.
- 학습
ai-agents/,mcp/, 및ai-security/
• AI 로그 분석 파이프라인 구축
• AI SRE 에이전트 구축
• 승인 게이트(approval gates), 감사 로그(audit logs), 롤백 제어(rollback controls) 추가.
STUDY_MATERIALS.md를 사용하여 보안 트레이드오프 문서화
| 모듈 | 주제 | 주요 성과물 |
|---|---|---|
| 1 | 기초 지식 | Linux, 네트워킹, Docker, Kubernetes 기본, CI/CD, Terraform, 스토리지 및 자동화. |
| ... | ||
| 프로젝트 | 학습 내용 | 여기서 시작하기 |
| --- | --- | --- |
| 로컬 RAG 어시스턴트 | Streamlit, Qdrant, 임베딩(embeddings), Ollama, 그리고 로컬 RAG 루프. | projects/local-rag-assistant/ |
| ... |
cat QUICKSTART.md
cat ROADMAP.md
cat STUDY_MATERIALS.md
cd projects/ai-devops-copilot
python -m pip install -r requirements.txt
python copilot.py generate kubernetes --prompt "nginx 배포 3개 복제본"
python -m pytest projects/*/tests -q
일부 실습에서는 Docker, Kubernetes, GPU, Ollama 또는 모델 다운로드가 사용됩니다. 이러한 서비스가 사용할 수 없을 경우, 학습자가 워크플로우를 여전히 검사할 수 있도록 로컬 시뮬레이션 폴백(fallbacks)을 포함한 여러 예제가 제공됩니다.
로드맵을 진행하면서 다음 도구들을 설치하세요:
- Python 3.10+ 또는 3.11+
- Docker 및 Docker Compose
kubectl
, Kind 또는 Minikube - Terraform - Ollama 또는 다른 로컬 모델 런타임
- Markdown 및 Mermaid 미리보기 지원이 되는 코드 에디터
- 선택 사항: GPU 실습을 위한 NVIDIA GPU 드라이버 및 CUDA 툴킷
저장소에는 학습 프로젝트와 예제를 위한 테스트 및 검증 워크플로우가 포함되어 있습니다:
python -m pytest projects/*/tests -q
python -m flake8 . --count --select=E9,F63,F7,F82 --show-source --statistics
python -m black --check $(git ls-files '*.py')
GitHub Actions 워크플로우는 지원되는 경우 Markdown 링크, YAML 구문, Dockerfile 및 보안 스캔도 검증합니다.
이것들은 저장소를 더 유용하고 프로덕션 환경과 유사하게 만들기 위한 가장 가치 높은 다음 개선 사항들입니다:
-
각 최종 프로젝트(capstone project)마다 스크린샷이나 짧은 GIF 데모를 추가합니다.
-
Mermaid와 PNG/SVG 파일을 사용하여 모든 프로젝트의 README에 아키텍처 다이어그램을 추가합니다.
-
KV cache, quantization, embeddings, HNSW, MCP, guardrails와 같은 AI 인프라 용어에 대한 용어집(glossary)을 추가합니다.
-
새로운 기여자들을 안내하기 위해 초급(beginner), 중급(intermediate), 고급(advanced) 이슈 레이블을 추가합니다.
-
학습자들이 자신의 포크(fork)로 복사할 수 있는 진행 상황 추적기 템플릿을 추가합니다.
-
모든 실행 가능한 프로젝트에 대해
.env.example파일을 추가합니다. - 모든 Docker Compose 서비스에 건강 검사(health checks)를 추가합니다. -
CPU 전용 모드와 GPU 활성화 모드를 위한 Docker Compose 프로파일을 추가합니다.
-
공유된
scripts/디렉터리 아래 각 프로젝트에 대한 스모크 테스트(smoke-test) 스크립트를 추가합니다. - 리포지토리 루트에test,lint,format,links,docs를 위한 Make 타겟을 추가합니다. -
요청/응답 예시가 포함된 vLLM OpenAI 호환 추론 데모를 추가합니다.
-
청킹(chunking) 변경 전후의 검색 품질을 점수화하는 RAG 평가 노트북 또는 스크립트를 추가합니다.
-
동일한 프롬프트 세트에서 Ollama, llama.cpp, vLLM을 비교하는 모델 서빙 벤치마크를 추가합니다.
-
프롬프트 주입(prompt-injection) 테스트 및 출력 검증에 대한 예시를 추가합니다.
-
안전한 읽기 전용 Kubernetes 진단 정보를 노출하는 MCP 서버 예시를 추가합니다.
-
벡터 데이터베이스 및 추론 서비스에 대한 Kubernetes NetworkPolicy 예시를 추가합니다.
-
읽기 전용 에이전트와 승인 게이트가 있는 복구(remediation) 에이전트에 대한 RBAC 예시를 추가합니다.
-
환경 변수, sealed secrets 또는 클라우드 비밀 관리자를 사용하는 비밀 관리 예시를 추가합니다.
-
RAG 어시스턴트, AI SRE 에이전트, DevOps 코파일럿에 대한 위협 모델(threat models)을 추가합니다.
-
인프라 상태를 읽거나 복구를 제안하는 모든 에이전트 작업에 대한 감사 로깅(audit logging)을 추가합니다.
-
사용 가능한 경우 플레이스홀더 커뮤니티 링크를 실제 커뮤니티 채널로 교체합니다.
-
CODEOWNERS파일을 추가합니다.
프로젝트/모듈 소유권 파일을 추가합니다. - 문서, 실습(labs), 코드 변경을 위한 풀 리퀘스트 템플릿을 추가합니다.
- 주요 커리큘럼 업데이트를 위한 릴리스 체크리스트를 추가합니다.
- 다음 로드맵 개선을 위한 공개 프로젝트 보드 또는 마일스톤 목록을 추가합니다.
기여는 언제나 환영입니다. 좋은 첫 기여에는 다음과 같은 것들이 포함됩니다:
- 깨진 링크나 오타 수정.
- 실습 지침 개선.
- 다이어그램이나 스크린샷 추가.
- 프로젝트 예제에 대한 테스트 추가.
- 보안 참고 사항 및 프로덕션 강화 가이드라인 추가.
PR을 열기 전에 CONTRIBUTING.md를 읽고 변경 사항을 집중적으로 유지하세요.
이 파일들을 함께 사용하세요:
QUICKSTART.md: 가장 빠르게 실습에 진입하는 지점입니다.
ROADMAP.md: 24주 학습 계획입니다.
STUDY_MATERIALS.md: 선별된 외부 자료 및 포트폴리오 아이디어입니다.
TROUBLESHOOTING.md: 일반적인 설정 및 실행 시간 문제 해결을 위한 문서입니다.
BADGES.md: 학습자 성취도 아이디어를 위한 문서입니다.
이 프로젝트는 MIT 라이선스 하에 배포됩니다.
플랫폼을 구축하고, 지능을 운영하며, 모든 것을 문서화하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub ML Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기