World Model Hardware Accelerator
요약
본 문서는 Diffusion Transformer의 추론 가속기인 WMHA(World Model Hardware Accelerator)를 소개합니다. 이 장치는 지연 시간 최적화를 목표로 하며, 16x16 이중 점 배열과 온라인 softmax 어텐션 파이프라인을 활용하여 FP8 및 BF16 축약 연산을 스트리밍합니다. SystemVerilog로 구현되어 UVM 환경에서 검증되었으며, 기존 대비 MSE를 크게 감소시키는 성능을 입증했습니다.
핵심 포인트
- WMHA는 Diffusion Transformer의 추론 가속기입니다.
- 지연 시간 최적화에 초점을 맞춘 하드웨어 설계입니다.
- FP8/BF16 축약 연산 및 온라인 softmax 어텐션을 사용합니다.
- SystemVerilog로 구현되었으며 UVM 환경에서 검증되었습니다.
Diffusion transformer는 자기회귀 디코딩이 익숙하게 만든 산술 연산을 역전시킵니다. 토큰별 재귀(recurrence)가 존재하지 않습니다: 모든 노이즈 제거 단계(denoising step)는 정적 형태(static shapes)에 대한 전체 시퀀스 순방향 통과(forward pass)이기 때문에, 전체 스케줄은 컴파일 시간에 알려지며 유일한 직렬 차원(serial dimension)은 단계 수 자체입니다. 우리는 이러한 구조를 WMHA(World Model Hardware Accelerator)에서 활용합니다. 이는 지연 시간 우선(latency-first)의 diffusion-transformer 추론 가속기입니다: 매우 긴 명령어 워드 시퀀서가 하나의 명령어 워드로부터 네 개의 엔진을 발행하고, 가중치 정지형(weight-stationary) 16x16 이중 점 배열(dual-dot array)이 FP8 및 BF16 축약 연산(contractions)을 스트리밍하며, 단일 통과 온라인 softmax 어텐션 파이프라인이 왜곡된 소프트웨어 파이프라인을 통해 키와 값(keys and values)을 상주시킵니다. 이 설계는 고정된 마이크로아키텍처 문서에 명시되어 있으며, 합성 가능한 SystemVerilog로 구현되었고, UVM 환경의 double-precision 참조 모델과 검증되었습니다. 이 환경의 수용 기준은 의미론적(semantic)입니다: 장치는 실제 노이즈 제거 궤적을 실행하고 깨끗한 잠재 변수(clean latent)에 대한 평균 제곱 오차(mean squared error)를 최소 10배 감소시켜야 합니다. 실제로 두 가지 합성 구성 모두에서 23배의 비율로 이를 달성했으며, 검사된 2억 3천 7백만 개의 값 전체에서 요소 실패가 없었습니다. 원래 diffusion-transformer 구성을 포함하여 출판된 모델 형태로부터 구축된 11개의 애플리케이션 벤치마크가 장치에서 실행되었고, 측정된 점유율(occupancy)과 별도로 레이블링된 투영값(projections)을 보고했습니다. 다섯 개의 엔진은 기생 성분 주석이 달린 타이밍 및 측정 활동 전력(measured-activity power)을 가지고 sky130에 라우팅 레이아웃으로 가져갔습니다: 전체 칩은 합성되었고, 배치 및 라우트(place-and-route)를 중단시킨 호스트 한계(host limit)와 그것을 제거할 수 있는 기계가 함께 정량화되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AR의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기