DSTAR: 공간 및 시간적 중복성 감소를 통한 Diffusion Transformers 가속화
요약
Diffusion Transformers(DiTs)의 추론 효율성을 높이기 위해 공간적·시간적 중복성을 줄이는 DSTAR 프레임워크를 제안합니다. 혼합 정밀도 양자화와 희소 어텐션 재사용을 결합한 소프트웨어-하드웨어 공동 설계 방식을 통해 성능 저하 없이 가속화를 달성했습니다.
핵심 포인트
- 공간 및 시간적 중복성 감소를 통한 DiT 추론 가속화
- 혼합 정밀도 양자화 및 희소 어텐션 재사용 메커니즘 도입
- NVIDIA A100 대비 최대 7.33배 지연 시간 가속 달성
- 에너지 소비를 최대 41.89배 절감하는 하드웨어 가속기 설계
Diffusion Transformers (DiTs)는 이미지 합성, 비디오 생성, 콘텐츠 편집을 포함한 많은 작업에서 널리 사용되어 왔습니다. 그러나 이들의 다중 반복 추론(multi-iteration inference) 과정은 성능 비효율성과 높은 에너지 소비를 초래합니다. 기존의 가속화 방법들은 주로 인접한 타임스텝(timesteps) 사이의 시간적 중복성(temporal redundancy)을 줄이는 데 집중하지만, DiT의 특수한 특징들을 간과하는 경우가 많습니다. 그 결과, 이러한 접근 방식들은 심각한 정확도 저하를 겪거나 높은 효율성을 달성하는 데 실패합니다. 우리는 공간적 및 시간적 중복성을 줄임으로써 DiT 추론을 가속화하는 소프트웨어-하드웨어 공동 설계(software-hardware co-design) 프레임워크인 DSTAR를 제안합니다. 알고리즘 수준에서, DSTAR는 선형 연산(linear operations)에서의 차분 활성화(differential activations)를 위한 미세 조정된 혼합 정밀도 양자화(mixed-precision quantization) 방법을 도입하여, 저비트 연산(low-bit computations)의 비율을 크게 높입니다. 또한, DSTAR는 어텐션 레이어(attention layers)에서의 중복 연산을 최소화하기 위해 희소 어텐션 재사용(sparse attention reuse) 메커니즘을 통합합니다. 아키텍처 지원을 위해, 우리는 지연 시간(latency)과 에너지 소비 모두에서 높은 효율성을 달성하는 특화된 하드웨어 가속기를 설계합니다. 7개의 전형적인 DiT에 대한 평가 결과, DSTAR는 정확도 저하 없이 NVIDIA A100 GPU 대비 최대 7.33배의 지연 시간 가속과 41.89배의 에너지 절감을 달성하였으며, 최신(SOTA) 가속기 대비 최대 2.54배의 지연 시간 가속과 3.68배의 에너지 절감을 달성했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기