Longformer의 대역형 희소 행렬-밀집 행렬 곱셈을 위한 파이프라인 FPGA 아키텍처
요약
본 논문은 Longformer의 대역형 희소 어텐션 행렬-밀집 행렬 곱셈(SpMM)을 가속하기 위한 파이프라인 FPGA 아키텍처를 제안합니다. 이 설계는 Longformer의 예측 가능한 구조화된 희소성 패턴을 활용하여 기존 오버헤드를 제거하고 규칙적인 메모리 접근을 가능하게 합니다. Verilog와 Vivado 2024.2로 구현한 결과, 초당 1억 개 이상의 내적 곱셈 출력을 달성하며 높은 처리량과 낮은 전력 소비를 입증했습니다.
핵심 포인트
- Longformer의 대역형 SpMM 가속을 위한 파이프라인 FPGA 아키텍처 제시
- 구조화된 희소성을 활용하여 메모리 오버헤드를 제거하고 규칙적 접근 구현
- RFSoC 플랫폼에서 초당 1억 개 이상의 내적 곱셈 출력을 달성하며 성능 입증
희소 어텐션 메커니즘은 전체 셀프-어텐션(full self-attention)에 비해 낮은 계산 및 메모리 복잡도를 가지므로, 긴 입력 시퀀스를 처리하는 트랜스포머 모델에서 점점 더 중요해지고 있습니다. Longformer는 슬라이딩 윈도우 어텐션 메커니즘을 통해 구조화된 대역형 희소 어텐션 행렬을 생성함으로써 이를 달성합니다. 하지만 기존의 희소 트랜스포머 가속기들은 주로 어텐션 생성이나 비구조적 희소성에 초점을 맞추고 있어, 구조화된 희소 어텐션을 위한 희소 행렬-밀집 행렬 곱셈(SpMM)은 아직 충분히 탐구되지 않은 영역입니다. 본 논문에서는 Longformer의 대역형 SpMM을 가속하기 위한 파이프라인 FPGA 아키텍처를 제시합니다. 제안된 설계는 암시적 인덱싱을 갖춘 사용자 정의 행별 저장 방식(row-wise storage scheme)을 통해 Longformer 어텐션 행렬의 예측 가능한 희소성 패턴을 활용하여, 기존 희소 행렬 형식의 오버헤드를 제거하는 동시에 규칙적인 메모리 접근을 가능하게 합니다. 이 아키텍처는 병렬 처리 요소, 파이프라인 가산기 트리(pipelined adder trees), 그리고 듀얼 패스 컴퓨테이션 전략을 사용하여 처리량과 하드웨어 활용도를 극대화합니다. Verilog로 구현하고 Vivado 2024.2를 사용한 RFSoC 플랫폼에서 평가한 결과, 이 가속기는 초기 지연 시간(latency) 11 사이클 이후 클럭 사이클당 하나의 완전한 내적 곱셈(dot-product) 결과를 유지하며 전력 소비는 2.9 W 미만을 유지했습니다. 100 MHz로 작동하면서, 본 설계는 초당 1억 개 이상의 내적 곱셈 출력을 달성하여 구조화된 희소성을 직접 활용하는 것이 희소 트랜스포머 가속에 얼마나 효과적인지 입증했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기