ScaleLUT: 실시간 다중 스케일 초해상도를 위한 완전 병렬 구성 가능한 LUT 기반 가속기
요약
본 논문은 실시간 다중 스케일 초해상도(SR) 처리를 위해 완전 병렬 구성이 가능한 LUT 기반 가속기인 ScaleLUT를 제안합니다. ScaleLUT는 YUV 도메인의 하드웨어 친화적 전략과 2의 거듭제곱 커널을 결합하여, 기존 대비 메모리 사용량을 줄이고 수용 영역 커버리지를 개선했습니다. Xilinx ZCU102 FPGA에 구현되어 실시간 4K SR을 높은 프레임률로 달성하며 에너지 효율성을 입증했습니다.
핵심 포인트
- LUT 기반 가속기로 MAC 연산 부담 감소
- YUV 도메인 및 완전 병렬 아키텍처 채택
- 기존 대비 메모리, 전력 소모 대폭 절감
- Xilinx FPGA 구현으로 실시간 4K SR 성능 입증
실시간 초해상도(SR)는 딥러닝 기반 방법들이 상당한 곱셈-누산(MAC) 연산, 자원 및 전력을 요구하기 때문에 엣지 디바이스에서 여전히 어려운 과제입니다. 조회 테이블(LUT) 기반 SR은 컨볼루션 추론을 테이블 질의로 대체하여 계산량을 줄이지만, 기존 방법들은 여전히 제한된 속도, 큰 저장 오버헤드, 그리고 업샘플링 계수 전반에 걸친 낮은 확장성 문제로 고통받고 있습니다. 본 논문에서는 실시간 다중 스케일 SR을 위한 하드웨어 중심의 LUT 설계 프레임워크이자 완전 병렬 재구성 가능한 가속기인 ScaleLUT를 제시합니다. ScaleLUT는 YUV 도메인의 하드웨어 친화적인 전략과 2의 거듭제곱 커널 및 회전 앙상블(rotation ensemble)을 결합하여, LUT 차원을 줄이는 동시에 수용 영역(receptive-field) 커버리지를 개선합니다; 나눗셈 연산은 시프트(shift)로 대체됩니다. 이러한 설계는 최신 LUT 기반 SR 방법 대비 메모리를 18.4% 감소시킵니다. ScaleLUT는 깊게 파이프라인화되고 대규모 병렬 아키텍처를 사용하여 임의의 입력 해상도와 구성 가능한 x2^n 업샘플링 계수를 지원합니다. Xilinx ZCU102 FPGA에 구현되었으며, 300 MHz에서 x2 업스케일링 시 실시간 4K SR을 95.3 FPS로 달성했습니다. 기존 SR 가속기들과 비교했을 때, ScaleLUT는 최적의 CPU 기반 SR 구현 및 이전 FPGA 기반 SR 가속기 대비 각각 최소 58.6% 적은 LUT, 41.1% 적은 플립플롭(flip-flops), 제로 DSP, 그리고 42.0% 낮은 전력을 사용하면서도, 각각 10배와 1.2배의 속도 향상을 제공합니다. 이러한 결과는 실용적이고 에너지 효율적인 엣지 SR 배포를 위한 LUT 알고리즘과 하드웨어 공동 설계를 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기