효율적인 CNN 추론을 위한 열 기반 압축(Column-Wise Compression)을 적용한 유연한 희소성
요약
자원 제약 환경에서 CNN 추론 효율을 높이기 위한 FPGA 기반 가속기 SparHiXcel-v2를 제안합니다. 열 기반 커널 압축과 하드웨어-알고리즘 공동 설계 프레임워크를 통해 희소성 유연성과 하드웨어 효율성 사이의 균형을 최적화했습니다.
핵심 포인트
- 열 기반 커널 압축을 통한 불규칙한 희소성 패턴 처리
- 하드웨어-알고리즘 공동 설계 프레임워크 도입
- FPGA 상에서 VGG16 및 ResNet18의 처리량과 에너지 효율 개선
- 구조적 희소성 모드에서 높은 성능과 낮은 정확도 저하 달성
자원 제약이 있는 플랫폼에서 합성곱 신경망 (CNNs)을 효율적으로 가속하는 것은 희소성 패턴 (sparsity patterns)의 불규칙성과 그에 따른 하드웨어 오버헤드(overhead)로 인해 여전히 어려운 과제로 남아 있습니다. 비구조적 희소성 (unstructured sparsity)은 높은 모델 정확도를 제공하지만 하드웨어 매핑에서 상당한 비효율성을 초래하는 반면, 구조적 희소성 (structured sparsity)은 유연성이 감소하는 대가로 실행을 단순화합니다. 본 논문은 희소성 유연성과 하드웨어 효율성 사이의 개선된 균형을 달성하는 비용 효율적이고 구성 가능한 FPGA 기반 CNN 가속기인 SparHiXcel-v2를 제시합니다. 제안된 아키텍처는 확장 가능한 2차원 MAC 어레이를 중심으로 구축되었으며, 최소한의 하드웨어 오버헤드로 불규칙한 희소성 패턴을 효율적으로 처리할 수 있는 열 기반 커널 압축 (column-wise kernel compression) 기술을 도입합니다. 성능을 더욱 향상시키기 위해, 우리는 마이크로아키텍처 (microarchitecture)에 맞춤화된 순서 최적화 기법 (ordering optimization scheme)과 다단계 구조적 가지치기 및 복구 (multi-phase structured pruning and revival) 알고리즘을 포함하는 하드웨어-알고리즘 공동 설계 (hardware-algorithm co-design) 프레임워크를 제안합니다. VGG16 및 ResNet18에 대한 광범위한 평가를 통해, SparHiXcel-v2가 제안된 최적화 기술을 통해 처리량 (throughput)과 에너지 효율성 측면에서 상당한 개선을 달성함을 입증했습니다. 구조적 희소성 모드에서, 이 가속기는 비용 효율적인 AMD Kintex UltraScale+ FPGA 상에서 VGG16에 대해 2.5 TOPS 이상의 성능과 210 GOP/s/W를, ResNet18에 대해 1.1 TOPS 이상의 성능과 72 GOP/s/W를 달성하는 동시에 완만한 정확도 저하를 유지합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기