Show HN: 데이터 엔지니어링 북 – 오픈 소스, 커뮤니티 기반 가이드
요약
본 책은 대규모 언어 모델(LLM)의 성능을 좌우하는 핵심 요소인 '데이터'에 초점을 맞춘 오픈 소스 커뮤니티 가이드입니다. 단순한 이론을 넘어, 전처리 데이터 클리닝부터 멀티모달 정렬, RAG 파이프라인 구축까지 LLM 데이터 라이프사이클 전체를 체계적으로 다룹니다. 6개 파트와 13개의 챕터, 그리고 실제 코드를 포함한 5가지 엔드투엔드 프로젝트(예: Mini-C4 전처리 세트 구축, 법률 도메인 SFT 등)를 제공하여 실무 개발자가 즉시 적용 가능한 깊이 있는 지식을 얻을 수 있도록 설계되었습니다.
핵심 포인트
- LLM 성능의 상한선은 데이터 품질에 의해 결정되므로, 체계적인 데이터 엔지니어링 과정(Data Ops → AI Ops) 이해가 필수적입니다.
- 본 가이드는 전처리(Pre-training), 멀티모달 처리, 정렬 데이터 구축(SFT/RLHF), RAG 파이프라인 등 LLM의 전체 데이터 수명주기를 포괄합니다.
- 실습 중심 학습을 위해 Mini-C4 세트 구축, 법률 도메인 SFT, LLaVA 멀티모달 명령어 세트 등 5가지 엔드투엔드 프로젝트와 코드를 제공합니다.
- Ray Data, Spark, Dask 같은 분산 컴퓨팅 기술과 Parquet, Vector Databases(Milvus/Qdrant) 등의 최신 스택을 다룹니다.
Show HN: 데이터 엔지니어링 북 – 오픈 소스, 커뮤니티 기반 가이드
"데이터는 새로운 석유이지만, 정제하는 방법을 알아야만 한다."
대규모 모델(large models) 시대에 접어들면서 데이터 품질은 모델 성능의 상한선을 결정합니다. 하지만 LLM 데이터 엔지니어링(data engineering)에 대한 체계적인 자료는 여전히 매우 부족하여, 대부분의 팀이 시행착오를 겪으며 학습하고 있습니다.
본 책은 이러한 격차를 해소하기 위해 설계되었습니다. Common Crawl과 같은 방대한 노이즈 데이터 소스에서 고품질 코퍼스(corpus)를 추출하는 사전 학습 데이터 엔지니어링(Pre-training Data Engineering)부터, RAG 검색 증강(Retrieval Augmentation) 및 합성 데이터 생성(synthetic data generation)을 포함한 멀티모달 정렬(multimodal alignment)에 이르기까지 전체 기술 스택을 체계적으로 다룹니다. 주요 내용은 다음과 같습니다:
- 🧹 사전 학습 데이터 엔지니어링: Common Crawl과 같은 방대한 노이즈 데이터 소스에서 고품질 코퍼스를 추출하는 방법
- 🖼️ 멀티모달 데이터 처리: 이미지-텍스트 쌍, 비디오 및 오디오 데이터의 수집, 정제 및 정렬(alignment)
- 🎯 정렬 데이터 구축: SFT(Supervised Fine-Tuning) 명령어 데이터, RLHF(Reinforcement Learning from Human Feedback) 선호도 데이터, CoT(Chain-of-Thought) 추론 데이터의 자동 생성
- 🔍 RAG 데이터 파이프라인: 엔터프라이즈급 문서 구문 분석(parsing), 시맨틱 청킹(semantic chunking), 멀티모달 검색(multimodal retrieval)
심도 있는 이론적 설명 외에도, 실습 학습을 위해 실행 가능한 코드와 상세 아키텍처 디자인을 갖춘 5개의 엔드투엔드(end-to-end) 최종 프로젝트를 포함하고 있습니다.
원시 데이터부터 엔드투엔드 애플리케이션까지 완전한 데이터 엔지니어링 파이프라인
📖 6개 파트, 13개 챕터 + 5개 최종 프로젝트
-
Part 1: 인프라 및 핵심 개념 (Infrastructure & Core Concepts)
- Chapter 1: LLM 시대의 데이터 혁명 (Data Ops에서 AI Ops로)
- Chapter 2: AI 네이티브 데이터 스택 (AI-Native Data Stack)
-
Part 2: 대규모 텍스트 사전 학습 엔지니어링 (Large-Scale Text Pre-training Engineering)
- Chapter 3: 데이터 수집 (Data Acquisition)
- Chapter 4: 정제 및 품질 관리 (Cleaning & Quality Control)
- Chapter 5: 토큰화, 직렬화 및 효율적 로딩 (Tokenization, Serialization & Efficient Loading)
-
Part 3: 멀티모달 데이터 엔지니어링 (Multimodal Data Engineering)
- Chapter 6: 이미지-텍스트 쌍 처리 (Image-Text Pair Processing)
- Chapter 7: 재캡셔닝 (Recaptioning)
- Chapter 8: 비디오 및 오디오 데이터 (Video & Audio Data)
-
Part 4: 정렬 및 합성 데이터 엔지니어링 (Alignment & Synthetic Data Engineering)
- Chapter 9: 명령어 미세 조정 데이터 (Instruction Fine-tuning Data)
- Chapter 10: 합성 데이터 (Synthetic Data)
- Chapter 11: 인간 선호도 데이터 (Human Preference Data)
-
Part 5: 애플리케이션 수준의 데이터 엔지니어링 (Application-level Data Engineering)
- Chapter 12: RAG 데이터 파이프라인 (RAG Data Pipeline)
- Chapter 13: 멀티모달 RAG (Multimodal RAG)
-
Part 6: 최종 프로젝트 (Capstone Projects)
- Project 1: Mini-C4 사전 학습 세트 구축
- Project 2: 도메인 전문가 SFT (법률)
- Project 3: LLaVA 멀티모달 명령어 세트 구축
- Project 4: 합성 수학/코드 교과서
- Project 5: 멀티모달 RAG 금융 보고서 어시스턴트
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기