AI-Maker-Space/LLM-Engineering-Foundations-to-SLMs-Open-Source
요약
본 자료는 LLM Engineering의 기본 원리와 최신 모범 사례를 다루며, 모델 구축 및 배포 과정을 안내합니다. 트랜스포머 아키텍처부터 사전 학습, 미세 조정, 정렬(Alignment), 모델 병합 등 핵심 기술을 체계적으로 학습할 수 있도록 구성되어 있습니다.
핵심 포인트
- LLM Engineering은 LLM의 프로덕션 배포 전 최적화 과정을 의미합니다.
- 트랜스포머 아키텍처와 어텐션 메커니즘이 기본 원리입니다.
- 사전 학습, 미세 조정, 정렬 등 다양한 기술 스택을 다룹니다.
- 자신만의 모델 구축 및 배포 능력을 갖추게 됩니다.
대규모 언어 모델 엔지니어링 (Large Language Model Engineering, LLM Engineering)은 프로덕션 배포 이전에 LLM을 사전 학습(pretraining), 사후 학습(post-training)하고 최적화하는 새로운 모범 사례 및 도구를 의미합니다.
사전 학습과 사후 학습 기법에는 비지도 사전 학습 (unsupervised pretraining), 지도 미세 조정 (supervised fine-tuning), 정렬 (alignment), 모델 병합 (model merging), 증류 (distillation), 양자화 (quantization) 등이 포함됩니다. 그리고 기타 방법들이 있습니다.
*오늘날의 LLM Engineering은 GPT 스타일 트랜스포머 아키텍처로 수행됩니다.
**2024년 12월 기준, 오늘날의 소규모 언어 모델 (Small Language Models, SLMs)은 최대 70B 파라미터에 달할 수 있습니다.
본 과정에서는 LLM의 기본 원리를 가르치며, 여러분을 실용적인 LLM Engineering 영역으로 빠르게 안내합니다. 이 과정을 완료하면 최신 대규모 및 소규모 언어 모델이 어떻게 구축되는지 이해하게 될 것이며, 자신만의 모델을 구축하고 배포하며 공유할 준비가 될 것입니다.
🤖 트랜스포머 (The Transformer)
🧐 어텐션 (Attention)
🔠 임베딩 (Embeddings)
🪙 다음 토큰 예측 (Next-Token Prediction)
🔡 임베딩 모델 (Embedding Models)
🚇 사전 학습 (Pretraining)
🚉 미세 조정 (Fine-Tuning)
🛤️ 정렬 (Alignment)
🥪 모델 병합 (Model Merging)
⚗️ 증류 (Distillation)
그리고 LLM Edge에서 더 많은 것을 배울 수 있습니다!
| 세션 | 비디오 링크 | 코드 | 슬라이드 |
|---|---|---|---|
| 세션 1: 시작 및 모델 진화 (Kickoff & Model Evolution) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 2: 트랜스포머 (The Transformer) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 3: 어텐션 및 플래시 어텐션 (Attention & Flash Attention) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 4: 임베딩 (Embeddings) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 5: 다음 토큰 예측 (Next-Token Prediction) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 6: 사전 학습 (Pre-Training) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 7: 미세 조정 (Fine-Tuning) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 8: 정렬 (Alignment) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 9: 정렬 II (Alignment II) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
| 세션 10: 최전선 (Frontiers) | 🎥 비디오 | 🐙 레포 | 💻 슬라이드 |
저희는 협업의 힘을 믿습니다. 기여, 아이디어 및 피드백은 매우 환영합니다! 함께 궁극적인 LLME 리소스를 만들어 봅시다. 🤝
궁금한 점이나 제안 사항이 있으면 언제든지 연락 주십시오. 즐거운 코딩 되세요! 🚀🔮
AI 자동 생성 콘텐츠
본 콘텐츠는 GitHub Codex tools의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기