FINNAS: FPGA를 위한 FINN 기반 하드웨어 인식 NAS 및 가지치기 (Pruning) 프레임워크
요약
본 논문은 FPGA 환경에서 양자화된 신경망(QNNs)의 효율적인 배포를 위한 FINNAS 프레임워크를 제안합니다. 이 프레임워크는 MLP 깊이, 너비 및 정밀도 설정을 공동으로 탐색하며, 하드웨어 자원 사용량과 대리 검증 정확도를 기반으로 후보 모델을 순위화합니다. CERNBox 작업에서 테스트된 결과, FINNAS가 기존 설계 대비 높은 정확도와 현저히 낮은 LUT/지연 시간 감소를 달성했습니다.
핵심 포인트
- FINNAS는 FPGA 환경의 QNN 배포를 위한 하드웨어 인식 NAS 프레임워크입니다.
- MLP 깊이, 너비, 정밀도를 공동 탐색하여 최적 모델을 찾습니다.
- CERNBox 작업에서 정확도 향상과 LUT/지연 시간 감소 효과를 입증했습니다.
- 가지치기(Pruning)는 최종 후보의 자원 효율성을 추가로 높여줍니다.
FPGA는 엄격한 정확도, 지연 시간(latency), 자원 제약 조건 하에서 양자화된 신경망(QNNs)을 배포하는 데 적합합니다. 하지만 효율적인 모델-가속기 조합을 식별하려면 일반적으로 광범위한 수동 설계 공간 탐색과 반복적인 하드웨어 합성 과정이 필요합니다. 본 논문에서는 FINNAS, 즉 FINN 기반의 하드웨어 인식 진화적 신경망 구조 검색(evolutionary neural architecture search) 프레임워크를 제시합니다. FINNAS는 양자화된 MLP 깊이, 너비 및 전역 정밀도 설정을 공동으로 탐색하며, 완전 병렬 매핑 조건에서의 FINN 추정 LUT 사용량과 지연 시간과 함께 대리 검증 정확도(proxy validation accuracy)를 사용하여 후보들을 순위화합니다. 선택된 최종 후보들은 완전히 재훈련되고, 검색 후 비구조적 가지치기(unstructured pruning)를 거친 다음, RTL 시뮬레이션 및 Vivado out-of-context 합성으로 검증됩니다. CERNBox 제트 구조 분류 작업에서, 검색된 구현체는 경쟁력 있는 정확도-자원 트레이드오프를 보여줍니다. 수동으로 최적화된 밀집(dense) FINN 가속기와 비교했을 때, 간결한 FINNAS 설계는 정확도를 73.78%에서 74.36%로 향상시키고, LUT 사용량을 $8.5 imes$ 줄이며, RTL 시뮬레이션 지연 시간을 $1.77 imes$ 감소시킵니다. 비구조적 가지치기는 완전 병렬 최종 후보들 전반에 걸쳐 일관된 LUT 및 FF(플립플롭) 감소를 추가로 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기