NVIDIA의 Nemotron-Labs-Diffusion
요약
NVIDIA의 Nemotron-Labs-Diffusion은 어텐션 패턴 전환을 통해 AR 디코딩과 확산 기반 병렬 디코딩을 모두 지원하는 삼중 모드 언어 모델입니다. 특히 확산 기반 초안 작성과 AR 검증을 결합한 '셀프 스펙큘레이션' 기술을 통해 기존 MTP 방식보다 훨씬 높은 디코딩 효율성과 속도를 제공합니다.
핵심 포인트
- AR, 확산(Diffusion), 셀프 스펙큘레이션(Self-speculation)을 지원하는 SOTA 밀집 언어 모델 제품군 출시
- 셀프 스펙큘레이션 기술을 통해 Qwen3-8B-Eagle3 대비 3배 높은 수락 길이와 2.2배의 속도 향상 달성
- 생성 방식을 메모리 제한 영역에서 연산 제한 영역으로 이동시켜 모델 가중치 재사용성 극대화
- GB200 환경에서 커스텀 CUDA 커널 사용 시 기존 AR 대비 최대 4배(1015 tok/sec)의 속도 향상 구현
모델 개요
Nemotron-Labs-Diffusion은 추론(Inference) 중에 동일한 모델의 어텐션 패턴(Attention pattern)을 전환하는 것만으로 AR 디코딩(AR decoding)과 확산 기반 병렬 디코딩(Diffusion-based parallel decoding)을 모두 지원하는 삼중 모드 언어 모델(Tri-mode language model)입니다. 이 두 모드 사이의 시너지는 셀프 스펙큘레이션(Self-speculation)이라 불리는 세 번째 모드를 가능하게 합니다. 즉, 동일한 모델이 공유된 KV 캐시(KV cache)를 사용하여 확산 기반의 병렬 초안 작성(Diffusion-based parallel drafting)과 AR 검증(AR verification)을 수행함으로써, 높은 수락 길이(Acceptance lengths)와 디코딩 효율성을 달성합니다. 어텐션 패턴을 변경하는 것만으로 가능한 원활한 모드 전환을 통해, 단일 모델로 다양한 배포 시나리오의 서로 다른 동시성(Concurrency) 수준에서 높은 효율성을 구현할 수 있습니다.
주요 특징
- 디코딩 효율성에 초점을 맞춘 AR, 확산(Diffusion), 셀프 스펙큘레이션(Self-speculation)을 지원하는 SOTA 3B, 8B, 14B 밀집 언어 모델(Dense LM) 제품군 (Base, Instruct, Vision-language 변체 포함).
- 생성 방식이 메모리 제한(Memory-bound) 영역에서 연산 제한(Compute-bound) 영역으로 이동했습니다. 모델 가중치(Model weights)는 한 번만 로드되며 생성 중에 여러 토큰을 계산하는 데 재사용됩니다.
- 셀프 스펙큘레이션(Self-speculation)은 초안 작성을 위해 확산(Diffusion)을 사용하고 검증을 위해 AR을 사용하여 MTP 방식에 대한 더 강력한 대안을 제공합니다:
- SGLang 환경의 Qwen3-8B-Eagle3 대비 3배 더 높은 수락 길이와 2.2배의 속도 향상.
- 동일한 정확도에서 Qwen3-8B(MTP 미사용) 대비 포워드(Forward)당 5.9배 많은 토큰 생성.
- 플랫폼 전반에 걸친 실제 장치 속도 향상:
- DGX Spark (8B, 동시성 1): w4a16 사용 시 41.8 tok/sec의 AR 대비 112 tok/sec로 2.7배 빠름.
- GB200 (8B, 동시성 1): 253 tok/sec의 AR 및 360 tok/sec의 Eagle3 대비 850 tok/sec로 3.3배 빠름. 커스텀 CUDA 커널을 통해 1015 tok/sec(4배)까지 향상.
- 확산 속도 광속 분석(Diffusion speedup-of-light analysis)에 따르면, 더 나은 샘플링을 사용할 경우 단일 사용자에 대해 (현재 최고 수준 대비) 처리량(Throughput)을 추가로 두 배까지 늘릴 수 있음을 보여줍니다 - 향후 연구 과제.
https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-VLM-8B
https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B-Base
다음은 Nemotron-Labs-Diffusion 모델의 다양한 버전 링크입니다.
https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B
https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B-Base
https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B
https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-3B-Base
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기