실리콘부터 에이전트까지, ML 모델을 실제로 빠르게 만드는 방법에 대한 무료 오픈소스 책
요약
이 책은 ML 모델의 속도 최적화에 대한 시스템적인 접근 방식을 제시합니다. 단순히 FLOPs를 줄이는 것만으로는 충분하지 않으며, 루프라인 분석을 통해 병목 현상의 근본 원인(컴퓨팅, 대역폭, 메모리 등)을 파악하는 것이 중요하다고 강조합니다. 하드웨어부터 에이전트 시스템까지 전 과정을 다루며 실질적인 성능 엔지니어링 지식을 제공합니다.
핵심 포인트
- 모델 속도 최적화는 FLOPs 감소만으로는 부족하며 시스템 관점 이해가 필수입니다.
- 루프라인 분석을 통해 컴퓨팅, 대역폭, 메모리 등 실제 병목 현상을 파악해야 합니다.
- 하드웨어(Silicon)부터 커널, 컴파일러, 양자화, 에이전트까지 전 과정을 다룹니다.
- 성능 엔지니어링 지식을 서빙 및 에이전트 시스템에 적용하는 방법을 제시합니다.
지난 몇 달 동안 제가 ML 성능 엔지니어링 작업을 시작했을 때 갖고 싶었던 무언가를 쓰느라 시간을 보냈습니다. 이 책의 제목은 'How to Make Your Model Fast: A Systems View of Efficient Machine Learning, from Silicon to Agents'입니다. 기본적인 아이디어는 FLOPs(Floating Point Operations)를 줄인다고 해서 반드시 모델이 빨라지는 것은 아니라는 것입니다. 어떤 것을 최적화하기 전에, 시스템이 실제로 무엇에 의해 제한되는지 이해해야 합니다. 이 책은 루프라인 분석(roofline analysis)과 하드웨어에서 시작하여 커널(kernels), 컴파일러(compilers), 양자화(quantisation), 가지치기(pruning), 비전(vision), 온디바이스 LLMs, 로보틱스(robotics), 프로파일링(profiling), 서빙(serving)을 거쳐 최종적으로 에이전트(agents)까지 다룹니다. 목표는 모델과 하드웨어를 보고 다음과 같이 추론할 수 있는 직관을 구축하는 것입니다: 이것이 얼마나 빠르게 실행될 수 있을까? 내가 컴퓨팅 제한인지, 대역폭(bandwidth) 제한인지, 메모리 제한인지, 아니면 시스템 제한인지? 어떤 최적화가 실제로 그 한계를 움직일까? 양자화, 가지치기 또는 커널 최적화를 여기서 하는 것이 과연 가치가 있을까? 동일한 사고방식을 서빙 및 에이전트 시스템에 적용하면 어떻게 될까? 전체 내용은 무료 오픈소스이며, https://github.com/usamahz/make-your-model-fast에서 확인할 수 있습니다. ML 시스템, 추론(inference), 컴파일러, 엣지 AI 또는 성능 엔지니어링 분야에서 일하는 분들의 피드백이나 기여를 진심으로 감사히 받겠습니다. 그리고 유용하다고 느끼신다면, ⭐을 남겨주시면 감사하겠습니다! /u/SoloTiger_ [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Research의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기