Deltoris: 비트 수준 희소성(Bit-level Sparsity)과 추측적 추론(Speculative Inference)을 통한
요약
Deltoris는 효율적인 확산 기반 VLA 모델 추론을 위한 알고리즘-하드웨어 공동 설계 프레임워크입니다. 비트 수준 희소성과 추측적 추론 기술을 통해 에지 디바이스의 지연 시간과 에너지 제약을 해결합니다.
핵심 포인트
- 시간 인지 비트 희소성을 통한 중복 연산 제거
- 추측적 추론 기술로 오프칩 트래픽 문제 해결
- 맞춤형 1D 시스톨릭 비트 직렬 PE 어레이 가속기 설계
- 모바일 GPU 대비 최대 34.2배 속도 향상 달성
시각-언어-행동 (Vision-language-action, VLA) 모델은 Embodied AI의 핵심 구성 요소로 부상했습니다. 기존 방식 중 확산 기반 (diffusion-based) VLA 모델은 우수한 동작 품질과 일반화 성능을 달성합니다. 그러나 확산 기반 VLA 모델은 연산 집약적이며, 예를 들어 50-200 Hz와 같은 높은 제어 주파수에서 실행되어야 합니다. 따라서 이는 에지 디바이스 (edge devices)에 엄격한 지연 시간 및 에너지 제약을 부과합니다. 본 연구에서는 효율적인 확산 기반 VLA 추론을 위한 알고리즘-하드웨어 공동 설계 (algorithm-hardware co-design) 프레임워크인 Deltoris를 제시합니다. 첫째, 우리는 연속된 입력 간의 시간적 유사성을 활용하여 연속된 입력 사이의 차이점만을 계산함으로써 중복되는 비트 수준 연산을 제거하는 extit{시간 인지 비트 희소성 (temporal-aware bit-sparsity)} 알고리즘을 제안합니다. 우리의 알고리즘으로 인해 발생하는 추가적인 오프칩 트래픽 (off-chip traffic) 문제를 더욱 해결하기 위해, 우리는 데이터 로딩을 여러 제어 단계에 걸쳐 분할 amortize하는 extit{추측적 추론 (speculative inference)} 기술을 제안합니다. 마지막으로, 이러한 기술들을 지원하기 위해 우리는 PE 워크로드 불균형을 제거하는 맞춤형 1D 시스톨릭 비트 직렬 PE 어레이 (1D systolic bit-serial PE arrays)를 갖춘 전용 가속기를 공동 설계합니다. 평가 결과, Deltoris는 유사한 정확도를 유지하면서 모바일 GPU 대비 최대 34.2배, 기존 가속기 대비 6.1배의 속도 향상을 달성함을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기