머신러닝 시스템 설계 및 운영 — 보트 레이스 예측 사이트 개발을 통해 배우는 데이터 수집, 모델링, 평가, 배포
요약
본 기사는 보트 레이스 예측 사이트를 개발하는 과정을 통해 데이터 수집, 모델링, 평가, 배포에 이르는 전체 머신러닝 시스템 구축 과정을 안내합니다. 공식 및 실시간 데이터를 활용하여 특징량 파이프라인을 가속화하고, 다양한 지표(적중률, 회수율 등)를 비교하며 예측 모델의 성능을 검증하는 방법을 다룹니다.
핵심 포인트
- 보트 레이스 도메인 지식을 바탕으로 데이터 수집 및 전처리 과정을 학습합니다.
- FeatureContext와 같은 파이프라인 가속화 기법과 비음수 제약 조건 최소 제곱법을 적용합니다.
- Cloud Run Jobs, Pub/Sub, Astro 등을 활용하여 배포 및 예측 페이지를 구축하는 방법을 다룹니다.
- 적중률, 회수율 등 다양한 평가 지표를 비교하고 A/B 실험을 통해 모델 성능을 검증합니다.
Chapters
서론: 이 책에서 만들 것들
보트 레이스의 도메인 지식
공식 데이터 수집: 1 경주당 1행의 CSV
직전 정보 및 실시간 수집
표준편차라는 공통 언어: 틀 번호(枠番pt)・선수pt・전시pt・기상pt
모터 능력 지수: z 잔차・시간 감쇠・베이즈 축소
특징량 파이프라인 가속화: FeatureContext
강점 포인트: 비음수 제약 조건 최소 제곱법
구매 조합 만들기: 강점 포인트에서 3연단 포메이션으로
적중률・회수율・log-loss: 무엇으로 판단할 것인가
예측자 레지스트리 및 A/B 실험
Cloud Run Jobs로 구동하기
침묵하는 실패와의 싸움
Pub/Sub에서 정적 사이트로: fun-site의 배치
Astro로 만드는 예측 페이지
스타트 예상도와 1마크 예상도
설명 가능성: 기여 분해 및 검산 페이지
적중률・회수율 대시보드
ST 추정: 가설 카탈로그 및 ablation
슬릿 전개: 할 수 없는 것을 증명하고 철수하기
틈새 예측(1): 난전도 미터와 결정 기술 모델
틈새 예측(2): 줄표・Plackett-Luce・블렌딩
결론: 배운 것과 다음 가설
부록: CSV 스키마 요약 및 참조 링크
Author
Topics
AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn ML의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기