SUSpMV: SUS로 작성된 HBM 기반 FPGA용 고주파 희소 행렬-벡터 곱셈기
요약
SUSpMV는 새로운 HDL인 SUS를 활용하여 HBM 기반 FPGA용 고주파 희소 행렬-벡터 곱셈(SpMV) 가속기를 개발했습니다. 이 아키텍처는 32개의 HBM 채널을 사용하고, DDR 메모리를 통해 입력/출력 벡터를 관리하며, 동적 타일링 및 효율적인 데이터 처리를 구현하여 높은 성능을 달성했습니다.
핵심 포인트
- SUS라는 새로운 HDL을 사용하여 SpMV 가속기를 설계함.
- 32개 HBM 채널과 32개의 컴퓨팅 유닛(CU)을 활용하여 고효율성을 확보함.
- 동적 타일링 및 데이터 저장 형식 전환으로 성능 최적화를 이룸.
- 이전 대비 79%의 기하 평균 개선된 성능을 입증함.
SUSpMV는 곧 출시될 HDL인 SUS를 사용하여 작성된 희소 행렬-벡터 곱셈(SpMV) 가속기입니다. SUS의 독특한 지연 시간 카운팅 및 추론 메커니즘을 활용하여, SUSpMV는 매우 깊은 파이프라인을 가지면서도 설계 복잡성 오버헤드가 작은 방식으로 설계될 수 있습니다. 이는 Alveo U280 FPGA에서 32개의 HBM 채널 전체를 사용하여 400MHz로 스트리밍되는 행렬 데이터를 32개 컴퓨팅 유닛(CU)에 공급하는 효율적인 구현을 가능하게 합니다. 입력 및 출력 벡터는 DDR 메모리에 저장되어, 곱셈의 제로 오버헤드 체이닝을 허용하고 CU와 HBM 대역폭을 공유하지 않음으로써 전체 시스템 메모리 대역폭을 증가시킵니다. 각 CU는 너비 1024와 최대 32768까지 동적으로 선택된 높이의 타일로 SpMV를 처리합니다. 각 CU는 사이클당 최대 6개의 별도 행렬 항목으로 곱셈을 누적할 수 있어, 결합된 이론적 피크 계산 처리량은 153.6 GFLOPs에 달합니다. 행렬 저장 형식은 주어진 행렬 내의 밀도 변화를 활용하도록 설계되었으며, 더 밀집된 영역에 최적화된 한 표현 방식과 더 희소한 영역에 최적화된 두 번째 표현 방식 사이를 동적으로 전환하여 각 항목 사이에 최대 255행까지 건너뛰기가 가능합니다. 평가 결과는 동일 플랫폼에서 이전 작업 대비 79%의 기하 평균 개선을 보여줍니다. 우리는 이론적 계산 처리량의 94%인 144.9 GFLOPs의 피크 처리량을 달성했으며, 이는 이전 작업이 도달한 98 GFLOPs와 비교됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기