설정 가능한 MAC과 동적 절단 기능을 갖춘 420 GOPS/W CGRA
요약
본 연구는 엣지 장치의 실시간 워크로드를 위해 고효율적이고 유연한 CGRA를 제안합니다. 핵심은 처리 요소(PEs)에 설정 가능한 MAC 유닛을 통합하여, 단일 사이클 내에서 ADD, MUL, 또는 MAC 연산을 수행할 수 있게 한 것입니다. 이 CGRA는 40nm CMOS 기술로 구현되어 420.6 GOPS/W의 높은 에너지 효율을 달성했습니다.
핵심 포인트
- 설정 가능한 MAC 유닛으로 단일 사이클 내 다중 연산 지원
- ADD, MUL, MAC 연산을 하나의 승산기/가산기로 처리하여 효율 증대
- 420.6 GOPS/W의 높은 에너지 효율을 달성한 CGRA 아키텍처 제안
엣지 장치는 역동적인 실시간 워크로드를 처리하기 위해 고효율적이면서도 유연한 처리 능력을 요구합니다. Coarse grain reconfigurable architecture (CGRA)는 일반 목적 프로세서만큼의 유연성을 가지면서도 도메인 특화 가속기(domain specific accelerators)에 근접한 높은 효율을 제공하므로, 엣지 장치에서 적합한 가속기 후보로 부상하고 있습니다. 하지만 일반적인 CGRA는 곱셈-누산(MAC: multiply-and-accumulate) 연산에 두 사이클이 필요하며, 신경망 추론(neural network inference)이나 신호 처리와 같은 워크로드는 많은 수의 MAC 연산을 포함하여 긴 CGRA 처리 시간을 초래합니다. 본 연구에서는 처리 요소(PEs)에 설정 가능한 MAC 유닛을 갖춘 CGRA를 제안합니다. 이 유닛은 동일한 승산기(multiplier)와 가산기(adder)를 사용하여 단일 사이클 내에서 덧셈(ADD), 곱셈(MUL), 또는 MAC 연산을 수행할 수 있습니다. 또한, 트렁케이션 블록(truncation block)을 통해 MAC 결과의 판독 정밀도(readout precision)를 조정할 수 있습니다. 제안된 CGRA는 40nm CMOS 기술로 구현되었으며, 공급 전압 0.6V 및 주파수 21MHz에서 작동 시 420.6 GOPS/W의 에너지 효율을 달성하여 기존 최첨단(state-of-the-art) 대비 1.4배 높은 성능을 보였습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기