
AI 엔지니어로서 반드시 학습해야 할 사항들
요약
AI 엔지니어가 실무에서 갖춰야 할 추론 최적화 및 서빙 역량을 정리한 가이드입니다. Roofline model 이해부터 vLLM 활용, 관측성 구축, 양자화 및 부하 테스트까지 10주간의 학습 로드맵을 제공합니다.
핵심 포인트
- 메모리 대역폭 및 Roofline model 기반의 디코딩 이해
- vLLM, SGLang 등 추론 엔진 및 PagedAttention 학습
- TTFT, Throughput 등 핵심 지표 관측성(Observability) 구축
- 양자화(FP8, INT4 등) 및 Speculative decoding 최적화
- Kubernetes 기반 오토스케일링 및 비용 효율적 모델 라우팅
AI 엔지니어로서 다음 사항들을 학습하세요:
- Roofline model (루프라인 모델)을 학습하고 왜 디코딩(decode)이 memory-bound (메모리 대역폭 제한)인지 이해하기
- vLLM과 SGLang을 배포해보고, 그들의 스케줄러(scheduler)를 읽어보기
- 블로그 포스트가 아닌 코드를 통해 PagedAttention (페이지드 어텐션) 이해하기
- 무엇인가를 최적화하기 전에 관측성(observability) 구축하기
- TTFT (첫 토큰 생성 시간), inter-token latency (토큰 간 지연 시간), throughput (처리량), queue depth (큐 깊이) 추적하기
- 추론 대시보드를 위해 Grafana + Prometheus 사용하기
- Prefix caching (접두사 캐싱)을 활성화하고 어떤 워크로드에 도움이 되는지 찾아내기
- Continuous batching (연속 배칭)과 Chunked prefill (청크 단위 프리필) 학습하기
- 1,000개 이상의 동시 요청으로 부하 테스트(load tests) 실행하기
- 평균값(mean)만 보고하지 말고 p50, p95, p99를 보고하기
- 양자화(quantization) 트레이드오프 마스터하기 (FP8, INT4, AWQ, GPTQ)
- Speculative decoding (추측적 디코딩)을 학습하고 이것이 도움이 되지 않는 지점이 어디인지 파악하기
- 긴 컨텍스트를 위한 KV cache eviction (KV 캐시 제거) 설정하기
- Disaggregated prefill (분리된 프리필) 및 decode (디코딩) 서빙 시도하기
- AI 워크로드를 위한 Kubernetes (쿠버네티스)를 학습하고 큐 깊이(queue depth)에 따라 오토스케일링(autoscale)하기
- 추론 비용이 유닛 이코노믹스(unit economics)를 어떻게 무너뜨리는지 학습하기
- 비용, 지연 시간, 품질에 따라 자신만의 모델 라우터(model router) 구축하기
- 요청당 토큰 예산(token budgeting) 시스템 만들기
- 하나의 추론 서비스를 구축하고 이를 공개적으로 벤치마크하기
- 모델 출시 뉴스 대신 추론 연구(inference research) 읽기
- 자신의 최적화 벤치마크 공유 시작하기
저는 이 모든 사항을 하루 30분씩 다루는 10주 계획을 준비했습니다. 이론 읽기와 직접 서비스를 구축하는 것으로 나뉜 총 50개의 세션으로 구성되어 있으며, 이 모든 과정은 하나의 결과물로 이어집니다: 바로 여러분이 직접 배포하고, 계측(instrument)하고, 1,000개 이상의 동시 요청으로 부하 테스트를 수행하며, 튜닝하고, 재현 가능한 벤치마크로 게시할 수 있는 추론 서비스입니다.
GitHub에 공개되어 있으며 기여(contribution)를 환영합니다. 특히 추가할 가치가 있는 새로운 자료들을 환영합니다. 저 또한 직접 진행하며 앞으로 더 많은 콘텐츠를 공유할 예정이니 계속 지켜봐 주세요.
GitHub repo: https://t.co/UTxKAzhzJQ
(star 🌟 누르는 것도 잊지 마세요)
[IMG:https://pbs.twimg.com/media/HOvVF59boAAi7XI.jpg]
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기