HCL이 고정된 마이크로아키텍처 MXFP4 가속기에 미치는 영향 정량화
요약
본 논문은 하드웨어 구성 언어(HCLs)의 효과를 정량적으로 비교합니다. 엣지 Physical-AI 추론의 핵심 블록인 OCP MXFP4 내적을 동일한 고정 디자인에 적용하여, SystemVerilog, Chisel, SpinalHDL 등 여러 HCL과 C++ 기반 HLS를 비교했습니다. 그 결과, HCL들은 면적 및 타이밍 측면에서 수작업 RTL과 유사하거나 우수한 성능을 보였으며, 선택은 QoR보다 생태계 적합성에 달려있음을 제시합니다.
핵심 포인트
- HCLs는 마이크로아키텍처를 변경하지 않고 설계 생산성을 높인다.
- OCP MXFP4 블록 내적 비교를 통해 HCL의 성능을 정량적으로 분석했다.
- HCL들은 면적과 타이밍 측면에서 수작업 RTL에 필적하는 우수한 결과를 보였다.
- 최종 선택은 QoR보다 생태계 적합성과 인터페이스 요구 사항에 따라 결정되어야 한다.
하드웨어 구성 언어(Hardware Construction Languages, HCLs)는 설계자의 마이크로아키텍처를 변경하지 않으면서 하드웨어 설계 생산성을 향상시키는 것을 목표로 합니다. 하지만 현재까지의 HCL 비교들은 질적인 수준이거나 다양한 설계를 가로지르는 결과 품질(Quality of Results, QoR)을 평가하는 경우가 많아, 언어 효과와 설계 효과를 분리하기 어렵습니다. 본 논문에서는 가장 널리 사용되는 HCL들을 동일한 고정된 디자인, 즉 엣지 Physical-AI 추론의 핵심 양자화 프리미티브인 OCP MXFP4 블록 내적(dot product)을 사용하여 비교합니다. 이 기능은 단일 12단계, II=1 파이프라인으로 구현되었습니다. SystemVerilog를 기준으로 삼고, Chisel, SpinalHDL, Amaranth, Clash, Bluespec, 그리고 고수준 합성(High-Level Synthesis, HLS)을 위한 C++로 구현했습니다. 모든 변형은 RISC-V 소프트 코어에 의해 구동되는 동일한 Artix-7 장치 세트에서 100 MHz의 동일한 흐름을 거칩니다. 마이크로아키텍처가 일정하게 유지되었기 때문에 비교는 명확합니다: 모든 변형이 타이밍을 충족하며, HCL들은 면적(area) 측면에서 수작업으로 작성된 RTL과 일치하거나 심지어 이를 능가합니다. 남아있는 차이는 알고리즘 자체에서 오는 것이 아니라, 각 백엔드가 산술 연산을 어떻게 낮추는지(lowers arithmetic), 그리고 DSP 추론을 조용히 토글하는 단일 폭 선택에서 비롯됩니다. 설계 결정이 프래그마(pragmas)로 제한되는 HLS와 달리, HCL들은 비교 가능한 면적과 타이밍을 달성합니다. 따라서 선택은 QoR보다는 생태계 적합성과 인터페이스 요구 사항에 달려 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기