RISC-V 기반 Edge AI를 위한 Transformer 추론 가속 프레임워크
요약
본 연구는 자원 제약적인 IoT 환경에서 트랜스포머 기반 언어 모델(LM) 추론을 가속화하는 프레임워크를 제시합니다. BERT-Tiny, MobileBERT 등 소형 LM에 맞춰 경량 명령어 세트 확장과 사용자 정의 명령어를 도입했습니다. 이를 통해 ASIC 및 FPGA 구현에서 높은 성능 향상(최대 2.19배)을 달성하며 효율성을 입증했습니다.
핵심 포인트
- RISC-V 기반으로 자원 제약적 환경의 LM 추론 가속화에 초점
- 경량 명령어 세트 확장과 사용자 정의 명령어를 활용하여 성능 향상
- ASIC 및 FPGA 구현에서 높은 추론 속도 향상을 입증 (최대 2.19배)
- 선택적 컴파일러 지향 루프 언롤링 전략을 추가 적용함
본 연구는 자원 제약적인 IoT 장치에서 트랜스포머 기반 언어 모델(LM)을 가속화하기 위한 프레임워크를 제시합니다. 이 프레임워크는 아키텍처적 다양성과 엣지 추론 시나리오에서의 사용 사례로 인해 선택된 BERT-Tiny (B-Ty), MobileBERT (M-Bt), MiniLM (M-Lm), Electra (E-Lt), DeBERTa (D-Bt)와 같은 소형 LM을 목표로 합니다. 제안된 흐름은 이러한 모델들의 명확하지 않은 계산 패턴에 맞춰진 경량 명령어 세트 확장을 도출합니다. 또한, 배치 행렬 곱셈의 주소 생성 단계를 가속화하기 위해 사용자 정의 명령어가 도입되었으며, 이는 면적에서 6.79%, 전력에서 2.33%의 적은 ASIC 오버헤드로 15.39~21.74%의 성능 향상을 달성합니다. 추가적인 프로세서 코어 하드웨어 비용을 발생시키지 않으면서 성능을 더욱 향상하기 위해, 선택적 컴파일러 지향 루프 언롤링(loop unrolling) 전략이 사용되었으며, 이는 전체 실행 시간 감소와 맞바꾸어 코드 크기 증가를 가져옵니다. Synopsys trv32p3f RISC-V 코어에서의 평가는 최대 2.19배의 추론 속도 향상을 입증했으며, AMD Zynq UltraScale+ ZCU102에 대한 FPGA 구현은 75 MHz에서 32.94%의 면적 오버헤드를 보인 반면, TSMC 28 nm 라이브러리를 사용한 ASIC 구현은 250 MHz 작동 시 21.08%의 면적 오버헤드를 발생시킵니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기