SANA-Video 2.0: 효율적인 비디오 생성을 위한 어텐션 잔차(Attention Residuals)를 포함한 하이브리드 선형
요약
SANA-Video 2.0은 선형 어텐션의 효율성과 소프트맥스 어텐션의 표현력을 결합한 하이브리드 아키텍처를 통해 고해상도 비디오 생성 문제를 해결합니다. AttnRes 메커니즘과 Sol-Engine 최적화를 통해 단일 GPU에서도 고품질 720p 비디오를 빠르게 생성할 수 있습니다.
핵심 포인트
- 하이브리드 선형-소프트맥스 어텐션 도입으로 계산 복잡도 완화
- AttnRes 메커니즘을 통한 심층 레이어의 유효 랭크 12% 증가
- Sol-Engine 최적화로 기존 모델 대비 최대 120배 속도 향상
- 단일 H100 GPU에서 720p 고해상도 비디오 생성 가능
무엇이 바뀌었나
비디오 확산 트랜스포머 (Video Diffusion Transformers, DiTs) 분야는 오랫동안 표준 소프트맥스 어텐션 (Softmax Attention)의 이차 복잡도 (Quadratic Complexity) 문제로 인해 제약을 받아왔습니다. 이는 막대한 계산 오버헤드 없이 길고 고해상도인 시퀀스를 생성하는 능력을 제한합니다. SANA-Video 2.0은 선형 어텐션 (Linear Attention)의 효율성과 소프트맥스 어텐션 (Softmax Attention)의 표현력을 결합한 하이브리드 아키텍처를 도입하여 이 문제를 해결합니다. 연구진은 기존 모델을 선형화하는 대신 처음부터 (from scratch) 학습시킴으로써, 단일 GPU에서 720p 해상도의 고품질 출력을 유지하면서도 5B 및 14B 파라미터 규모로 확장 가능한 시스템을 구축했습니다.
기술적 세부 사항
SANA-Video 2.0의 핵심 혁신은 하이브리드 선형-소프트맥스 어텐션 (Hybrid Linear-Softmax Attention) 메커니즘입니다. 전통적인 어텐션의 O(N^2) 복잡도를 완화하기 위해, 모델은 토큰 믹싱 (Token Mixing)의 대부분에 게이트형 선형 어텐션 (Gated Linear Attention)을 채택합니다. 고충실도 (High-fidelity) 비디오에 필요한 풀 랭크 (Full-rank) 토큰 상호작용을 모델이 놓치지 않도록, 3:1 비율로 주기적인 게이트형 소프트맥스 앵커 (Gated-softmax anchors)를 통합합니다. 이 구성은 저해상도 프록시 연구를 통해 품질과 계산 효율성 사이의 최적의 절충안임이 확인되었습니다. 또한, 이 아키텍처는 블록 어텐션 잔차 (Block Attention Residuals, AttnRes)를 도입합니다. 이 메커니즘은 완료된 블록 요약 (Block summaries)을 후속 선형 레이어로 전달하여, 앵커 특징 (Anchor-feature) 재사용을 용이하게 하고 심층 레이어의 유효 랭크 (Effective rank)를 약 12% 증가시킵니다. 모델은 커널 퓨전 (Kernel fusion), 캐싱 (Caching), 희소 어텐션 (Sparse attention)을 포함하는 풀스택 최적화 스위트인 Sol-Engine을 통해 더욱 최적화되었습니다. 이 스택은 아키텍처 개선 사항에 더해 3.58배의 속도 향상을 제공합니다.
벤치마크 분석
SANA-Video 2.0의 성능 향상은 전통적인 풀 소프트맥스 (Full-softmax) 비디오 DiT와 비교했을 때 매우 유의미합니다. 40단계 샘플링 (40-step sampling) 시, 모델은 84.30의 VBench 점수를 달성합니다. 지연 시간 (Latency) 측면에서, 단일 H100 GPU를 사용하여 13.2초 만에 480p 비디오를 생성합니다.
720p 해상도에서 컴파일된 DiT 순전파 (Forward Pass)는 동일한 조건의 풀 소프트맥스 (Full-softmax) 베이스라인보다 3.2배 더 빠릅니다. Sol-Engine 최적화를 완전히 활용할 경우, 5B 파이프라인은 13.06초 만에 720p/5s를 달성하며, 이는 Wan 2.2-A 14B 모델과 비교했을 때 120배의 속도 향상을 나타냅니다.
개발자 시사점 (Developer Implications)
개발자들에게 SANA-Video 2.0은 하드웨어 접근성이 더 높은 비디오 생성으로의 전환을 의미합니다. 단일 H100 GPU에서 고품질 720p 비디오 생성을 실행할 수 있는 능력은 프로덕션 규모의 배포를 위한 진입 장벽을 낮춰줍니다. 처음부터 학습시키는 (From-scratch training) 접근 방식은 하이브리드 어텐션 (Hybrid attention) 메커니즘이 사후 근사 (Post-hoc approximation)가 아닌 모델 가중치에 깊이 통합되도록 보장합니다. Sol-Engine에 대한 의존성은 향후 구현이 커스텀 커널 (Custom kernel) 개발 및 희소 어텐션 (Sparse attention) 전략으로부터 큰 이점을 얻을 것임을 시사하며, 이는 고성능 생성형 AI 파이프라인의 표준 요구 사항이 되어가고 있습니다.
결론 (Bottom Line)
SANA-Video 2.0은 고품질 비디오 생성을 위해 이차 어텐션 (Quadratic attention)이 반드시 필수적인 것은 아니라는 점을 입증합니다. 선형 어텐션 (Linear attention)과 소프트맥스 어텐션 (Softmax attention)을 전략적으로 혼합하고 블록 수준의 잔차 (Block-level residuals)를 활용함으로써, 이 모델은 지연 시간 (Latency)을 획기적으로 낮추는 동시에 경쟁력 있는 VBench 점수를 달성합니다. 이 아키텍처는 자원이 제한된 환경에서 장편의 고해상도 비디오 생성을 위한 확장 가능한 경로를 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기