SparseCraft: 희소 컴퓨팅을 위한 에이전트 기반 하드웨어-소프트웨어 공동 최적화
요약
SparseCraft는 언어 모델 기반의 폐쇄 루프를 사용하여 희소 가속기 설계 공간의 격차를 해소합니다. 이 시스템은 RTL, 메모리 구성 및 커널 스케줄을 편집하며, 시뮬레이션과 합성 전까지 후보 계산을 지연시켜 정확도를 높입니다. GraphChallenge 테스트에서 기존 대비 사이클 수 2.1배 감소, 온칩 트래픽 9.8배 절감 등 뛰어난 성능 향상을 입증했습니다.
핵심 포인트
- LLM 기반의 폐쇄 루프를 통해 하드웨어 설계 최적화
- RTL 및 메모리 구성 자동 편집을 통한 정확도 확보
- 사이클 수 2.1배 감소, 온칩 트래픽 9.8배 절감 등 성능 개선
희소 가속기 설계 공간은 보통 분석 모델에 대항하여 검색되므로, 설계 지점은 하드웨어가 실제로 작동하는 것보다는 모델이 예측하는 것에 의해 수용됩니다. SparseCraft는 폐쇄된 CHIA 루프 내의 언어 모델을 통해 이 격차를 해소합니다. 15번의 반복마다 모델은 이전 측정 결과를 읽고 MCP 도구 서버를 통해 Chisel RTL, 메모리 구성 및 Gemmini 가속기의 희소 커널 스케줄을 편집하며, 유효성 검사, 상세화, 사이클 정확도 시뮬레이션, 모든 출력에 대한 비트별 골든 레퍼런스 비교 확인, 그리고 합성 과정을 거치기 전까지 어떤 후보도 계산하지 않습니다. 이 하네스는 각 측정을 다음 작업 지시로 변환하며, 진단된 병목 현상과 일치하는 전략 가이드를 제공하고, 시도된 설계의 기록과 모델 자체 예측 점수를 제공합니다. 그리고 두 번째 모델은 게이트에 실패한 변경 사항을 복구합니다. $512 imes 512$ GraphChallenge 희소-DNN 레이어에서 이 루프는 블록-희소 Gemmini 기준선 대비 사이클 수를 2.1배 줄이고, 온칩 트래픽을 9.8배 적게 사용하며, 면적은 22.8% 감소시켰고, 모델링된 성능/W는 5.61배 높였으며, EDP(에너지-성능 곱)는 11.8배 낮췄습니다. 이 레버들은 세 가지 계층에 걸쳐 있습니다: 밀집 연산자를 온칩에 유지하는 스케줄은 트래픽을 9.8배 줄이고, 제로 게이팅 MAC과 제로 행 건너뛰기 유닛은 모델이 Chisel으로 작성하여 에너지를 절감했으며, 메모리 크기 조정은 면적을 줄입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기