FastCI: LLM 학습 프레임워크를 위한 효율적인 GPU 집약적 CI
요약
본 논문은 대규모 언어 모델(LLMs) 학습 프레임워크의 지속적 통합(CI) 효율성 문제를 다루며, FastCI라는 새로운 프레임워크를 제안합니다. FastCI는 런타임 증거와 테스트 가지치기 기법을 활용하여 영향을 받는 테스트만 선택하고, 고위험 테스트에 우선순위를 부여해 CI 지연 시간을 크게 단축시킵니다.
핵심 포인트
- FastCI는 LLM 학습 프레임워크의 CI 효율성을 개선합니다.
- 런타임 증거와 가지치기(pruning)를 활용하여 테스트 범위를 최적화합니다.
- CI 지연 시간 77.5% 감소, GPU 자원 사용량 63.9% 절감 효과가 입증되었습니다.
대규모 언어 모델(LLMs)의 크기와 복잡성이 계속 커짐에 따라, 이들의 학습 프레임워크 역시 빠르게 진화하고 있습니다. 따라서 지속적 통합(Continuous Integration, CI)은 이러한 프레임워크의 품질과 안정성을 유지하는 데 매우 중요합니다. 하지만 전통적인 소프트웨어와 달리, LLM 학습 프레임워크를 위한 CI는 보통 전체 모델 학습 또는 평가가 필요한 GPU 집약적 테스트에 의존합니다. 이로 인해 CI 자체가 빠르게 진행되는 개발 과정에서 새로운 병목 현상이 되고 있습니다. 본 논문에서는 LLM 학습 프레임워크의 CI 효율성을 개선하는 FastCI라는 프레임워크를 소개합니다. FastCI는 런타임 증거(runtime evidence)를 활용하여 영향을 받는 테스트를 선택하고, 변경된 코드가 실행되는 동일한 컨텍스트에서 테스트를 가지치기(prune) 합니다. 그런 다음 FastCI는 잠재적인 실패를 더 일찍 노출하기 위해 고위험 테스트에 우선순위를 부여하며, 각 테스트의 의도된 검증 범위를 벗어난 차원들을 따라 테스트 워크로드를 최적화합니다. 저희 LLM 학습 프레임워크의 CI 작업 부하에 대해 평가한 결과, FastCI는 현재 배포된 CI 파이프라인과 비교하여 CI 지연 시간을 77.5% 감소시키고 GPU 자원 사용량을 63.9% 줄였으며, 수정된 코드 커버리지 유지율은 3.2% 향상시키는 것으로 나타났습니다. FastCI는 현재 ByteDance의 LLM 학습 프레임워크 CI 파이프라인에 통합되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기