DynaTE: 동적 토큰 실행을 통한 Diffusion LLM 가속화
요약
본 논문은 Diffusion LLMs(dLLMs)의 디코딩 과정에서 발생하는 비효율성을 개선하기 위해 DynaTE라는 하드웨어-소프트웨어 공동 설계 아키텍처를 제안합니다. DynaTE는 토큰별 유용도에 따라 계산을 건너뛰고, 동적 의존성 활용 및 스트리밍 엔진을 통해 전체 노이즈 제거 반복 횟수와 오버헤드를 줄여 성능을 크게 향상시킵니다.
핵심 포인트
- dLLMs의 병렬 정제 방식은 기존 가속기와 비효율성이 존재함.
- DynaTE는 토큰 유용도에 따라 계산을 건너뛰어 적응형 실행을 구현함.
- 동적 의존성 활용 및 스트리밍 엔진으로 오버헤드를 줄이고 효율성을 높임.
- 평가 결과, 최신 dLLM 가속기 대비 2배 이상의 속도 향상과 높은 에너지 효율 달성.
Diffusion 기반 LLMs (dLLMs)는 최근 자가회귀(AR) LLMs의 대안으로 부상하며, 양방향 병렬 정제(bidirectional parallel refinement)를 가능하게 하여 AR 생성의 순차적 디코딩 병목 현상을 완화합니다. 하지만 dLLMs의 병렬 반복 정제 방식은 순차적 디코딩에 최적화된 AR 가속기와 맞지 않으며, 이들의 이산 토큰 생성 방식은 연속적인 노이즈 제거(denoising)를 위해 설계된 DiT 가속기와도 차이가 있습니다. 최근 dLLM 가속기들은 어휘 처리 오버헤드와 노이즈 제거 반복 전반의 중복 계산을 줄이기 위해 워크로드별 최적화를 탐구해 왔습니다. 하지만 이러한 접근 방식들은 토큰 정제 유용성(utility)과 실행 요구 사항이 다름에도 불구하고 모든 토큰을 병렬로 실행하는 경향이 있습니다. 본 논문은 dLLM 디코딩 중 진화하는 토큰 상태에 맞춰 가속기 실행을 동적으로 조정하는 하드웨어-소프트웨어 공동 설계 아키텍처인 DynaTE를 제시합니다. DynaTE는 첫째, 낮은 유용성의 토큰 계산을 건너뛰어 적응형 토큰 실행을 가능하게 하며, 차원 재구성 가능한 PE 배열(PE array)은 다양한 활성 토큰 패턴 하에서도 높은 활용도를 유지합니다. 둘째, DynaTE는 FLDD를 통해 동적 토큰 의존성을 활용하여 현재 반복 내에서 국소적으로 의존하는 소수의 토큰을 정제함으로써 전체 노이즈 제거 반복 횟수를 줄이고, Merge--Split--Merge 데이터 흐름(dataflow)은 그 결과로 발생하는 직렬 오버헤드를 숨깁니다. 셋째, 스트리밍 어휘 엔진(streaming vocabulary engine)은 선택적 토큰 계산과 불균일한 어휘 선택 요구 사항으로 인해 발생하는 불규칙한 출력 변화에 대응하기 위해 LM 헤드에서 여러 토큰 스트림을 번갈아 처리합니다. 대표적인 두 dLLM에 대해 평가했을 때, DynaTE는 최신 dLLM 가속기 대비 2.05--2.78$ imes$의 속도 향상과 2.99--3.93$ imes$ 높은 에너지 효율을 달성했으며, Jetson AGX Orin 대비로는 2.55$ imes$의 속도 향상과 6.07$ imes$ 높은 에너지 효율을 제공했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기