에뮬레이션 텐서 메모리 평형(TME) 모델의 누락된 네 번째 항: 잔여 분해 비용
요약
본 논문은 Tensor-Memory Equilibrium (TME) 모델의 누락된 입력당 분해 비용을 추가하여 에뮬레이션 정확도를 높였습니다. 이로 인해 cuBLAS 에뮬레이션 경로에서 네이티브 fp64와 일치할 수 없는 임계값 $\mathrm{OI}^{*}$를 도출했습니다. 그 결과, 메모리 바운드 커널의 성능 향상 폭이 예상보다 크게 줄어들었으며, 특정 연산은 원래 주장된 성능 대비 낮은 수준에 머무는 것으로 분석되었습니다.
핵심 포인트
- TME 모델에 누락된 입력당 분해 비용 항을 추가함.
- 네이티브 fp64와 일치할 수 없는 임계값 $\mathrm{OI}^{*}$를 도출함.
- 메모리 바운드 커널의 성능 향상 폭이 예상보다 낮음 (0.3-0.9배).
- 밀집(Dense) GEMM은 영향받지 않아 기존 예측과 일치함.
Tensor-Memory Equilibrium (TME) 모델은 "FP8 is All You Need (Part 1)"에서 fp64를 에뮬레이션하는 Ozaki Scheme II의 실행 시간을 텐서 코어 항과 고대역폭 메모리(HBM) 트래픽 항의 최댓값에, 출력당 재구성 항을 더한 값으로 계산합니다. 하지만 이 모델은 입력당 분해 비용을 누락했습니다: 모든 스트리밍되는 fp64 피연산자는 행렬 곱셈이 발생하기 전에 SIMT 파이프의 $r$개 모듈로 각각 스케일링, 반올림 및 나머지 연산을 거쳐야 합니다. 본 노트에서는 이 네 번째 항을 추가하고, cuBLAS 에뮬레이션 경로에서 그 상수를 보정하며, 에뮬레이션이 텐서 코어 처리량에 관계없이 네이티브 fp64와 일치할 수 없는 임계값인 폐쇄형 작동 강도(operational-intensity) 임계값 $\mathrm{OI}^{} = c_q r P_{\mathrm{fp64}}/(8P_{\mathrm{int}})$를 도출합니다. NVIDIA B300 GPU에서 이 임계값은 $\mathrm{OI}^{}\approx 0.56$ FLOP/B입니다. 결과적으로, 원래 논문이 가속한다고 주장했던 메모리 바운드 커널인 GEMV, SpMV 및 저배치 GEMV는 네이티브 성능의 0.3-0.9배로 제한되며, 7점 스텐실은 주장된 3.1배가 아닌 1.8배에 그칩니다. 밀집(Dense) GEMM은 예상대로 영향을 받지 않습니다. 또한 잔여값을 미리 계산하고 저장하는 것이 동일한 비용을 대역폭 항으로 이동시킨다는 것을 보여주고, 이 경계를 무효화하기 위해 구현이 달성해야 하는 명령어 수를 명시합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기