Meganeura: Vulkan 및 Metal을 통한 휴대 가능한 GPU 학습 및 추론
요약
Meganeura는 Vulkan 및 Metal API를 활용하여 소비자용 GPU에서 학습과 추론을 모두 수행할 수 있는 컴팩트한 네이티브 컴파일러를 제안합니다. 다양한 하드웨어 환경에서 PyTorch 워크로드를 비교 분석하여, 기존 프레임워크 대비 빠른 컴파일 속도와 경쟁력 있는 성능을 입증했습니다.
핵심 포인트
- Vulkan 및 Metal 기반의 통합 학습-배포 스택 제공
- torch.compile 대비 압도적으로 빠른 컴파일 속도(최대 2.4초)
- NVIDIA, AMD, Apple Silicon 등 다양한 GPU 환경 지원
- 소비자용 그래픽 API의 학습 및 추론 활용 가능성 확인
학습(Training) 및 배포된 추론(Inference)은 종종 내보내기(export), 변환(conversion), 그리고 플랫폼별 런타임(runtime) 경계를 넘나듭니다. Meganeura는 하나의 컴팩트한 네이티브 컴파일러(native compiler)가 소비자용 GPU에서 이 두 단계를 모두 아우를 수 있는지 질문합니다. Meganeura의 타입 지정 정적 그래프(typed static graph), 자동 미분(automatic differentiation), 옵티마이저(optimizer), 체크포인트(checkpoint), 메모리 플래너(memory planner) 및 런타임(runtime)은 Vulkan 및 Metal을 통해 특화된 프로그램을 하위 수준으로 변환(lower)합니다. 우리는 NVIDIA 및 AMD 외장 GPU(discrete GPUs), AMD APU, Apple silicon, 그리고 Intel iGPU에서 PyTorch를 사용한 다섯 가지 매칭된 워크로드(workloads)를 비교합니다. 프로토콜은 엄격한 f32(strict f32)를 검증된 패스트 패스(fast paths)와 분리하며, 순전파(forward)와 역전파(backward)를 독립적으로 제어합니다. 50개의 장치-워크로드-모드 셀(cells) 중 48개가 두 게이트를 모두 통과했으며, 나머지 두 개는 새로 지원되는 APU에서 해결되지 않은 하나의 역참조 불일치(backward-reference disagreement)를 공유합니다. 엄격한 f32 환경에서 Meganeura는 20개의 GPU 참조 최소 지연 시간(minimal-latency) 셀 중 12개에서 승리했으며, 유효한 학습 격차(training gap)의 중앙값은 1.8배입니다. AMD 외장 GPU에서는 5개의 추론 워크로드 중 4개가 컴파일된 ROCm PyTorch의 1.10배 이내이며, 3개의 학습 워크로드가 더 빠릅니다. 가속 계약(accelerated contracts) 하에서 최악의 학습 격차는 4.6배입니다. 컴파일은 지원되는 GPU 경로에서 torch.compile이 696초 걸리는 것에 비해 0.12.4초가 소요되며, 스트립된 바이너리(stripped binary) 크기는 13 MiB입니다. 디스패치 프로필(Dispatch profiles)은 가장 큰 격차가 컨볼루션 미분(convolution derivatives)과 어텐션 역전파(attention backward)에 국한됨을 보여줍니다. 물리적인 Android XR 사례 연구에서는 Meganeura로 학습된 디코더를 그래픽스 큐(graphics queue)를 공유하는 Adreno/OpenXR 애플리케이션으로 전송합니다. 결과는 일반적인 소비자용 그래픽 API가 유용하고 때로는 벤더와 경쟁할 만한 성능으로 컴팩트한 공유 학습-배포 스택(train-to-deploy stack)을 지원할 수 있음을 보여줍니다. 측정된 격차는 확인된 API의 한계보다는 커널 커버리지(kernel coverage), 스케줄링(scheduling), 그리고 산술 정책(arithmetic policy)을 가리킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.PL (Programming Languages)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기