CAMTA: 비선형 함수 근사를 위한 재구성 가능한 다중 영역 활성화 유닛
요약
FPGA 및 ASIC 가속기에서 비선형 활성화 함수를 효율적으로 근사하기 위한 재구성 가능한 유닛인 CAMTA를 제안합니다. CAMTA는 재합성 없이도 다양한 함수의 대칭성과 꼬리 동작을 지원하며, 기존 방식 대비 높은 정확도와 유연성을 제공합니다.
핵심 포인트
- 재구성 가능한 다중 영역 활성화 유닛(CAMTA) 설계
- Horner 기반 데이터패스를 통한 다양한 계산 모드 지원
- Softmax 구현 시 기존 CORDIC 방식보다 약 10배 낮은 RMSE 달성
- FPGA 및 TSMC 65nm ASIC 공정에서의 하드웨어 성능 검증
비선형 활성화 함수 (Nonlinear activation functions)는 머신러닝 워크로드에서 널리 사용되지만, 이를 하드웨어로 직접 구현하는 것은 종종 비용이 많이 들거나, 특정 함수에 국한되거나, 서로 다른 모델 간에 재사용하기 어렵습니다. 본 연구에서는 FPGA 및 ASIC 가속기에서 비선형 함수 근사를 위한 16비트 재구성 가능한 다중 영역 활성화 유닛인 CAMTA를 소개합니다. CAMTA는 공유된 Horner 기반 데이터패스 (datapath) 상에서 독립적인 영역 임계값 (region thresholds), 영역별 다항식 차수 (polynomial degrees), 계수 세트 (coefficient sets) 및 실행 모드를 결합합니다. 계수나 세그먼트 선택을 주로 재구성하는 기존의 다항식 또는 구간별 근사 (piecewise approximation) 유닛과 달리, CAMTA는 HORNER, CONST, ZERO, IDENTITY 모드를 통해 각 영역의 계산 동작을 재구성할 수 있어, 동일한 하드웨어로 재합성 (resynthesis) 없이도 서로 다른 대칭성 및 꼬리 동작 (tail behavior)을 가진 함수들을 지원할 수 있습니다. AMD Alveo 플랫폼에서의 FPGA 검증 결과, CAMTA를 지원하는 Softmax의 RMSE는 $3.60\times10^{-6}$만큼 낮게 나타났으며, 이는 본 연구에서 고려된 CORDIC 기반 Softmax 베이스라인보다 거의 한 자릿수(one order of magnitude) 더 우수한 성능을 보였습니다. FPGA HLS 합성 결과 3개의 DSP, 802개의 FF, 1756개의 LUT 및 11사이클의 데이터패스 지연 시간 (latency)을 기록했습니다. TSMC 65nm 공정에서의 250MHz ASIC 합성 결과, 총 셀 면적은 $6632.40~\mu\mathrm{m}^2$, 총 전력은 $1.3634~\mathrm{mW}$로 보고되었습니다. 동일 노드의 함수 특화형 PLAC 구현과 비교했을 때, CAMTA는 런타임 재구성 가능성 (runtime configurability)과 여러 비선형 함수에 대한 재사용성을 얻는 대신, 면적은 $2.20\times$, 전력은 $1.75\times$의 오버헤드가 발생합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기