
DiffusionGemma: 4배 더 빠른 텍스트 생성
요약
DiffusionGemma는 텍는 확산(text diffusion) 기술을 활용하여 기존 자기회귀 방식보다 최대 4배 빠른 텍스트 생성을 제공하는 실험적 오픈 모델입니다. 26B MoE 구조를 채택하여 추론 시 3.8B 파라미터만 활성화함으로써 소비자용 GPU에서도 효율적인 구동이 가능합니다.
핵심 포인트
- 텍스트 전체 블록을 동시에 생성하여 추론 속도 극대화
- NVIDIA H100 기준 초당 1,000개 이상의 토큰 생성 가능
- 26B MoE 모델로 추론 시 3.8B 파라미터만 사용하여 효율적
- 양방향 어텐션을 통해 256개 토큰을 병렬로 생성
- Apache 2.0 라이선스로 제공되는 실험적 오픈 모델
우리의 최신 오픈 실험 모델은 전용 GPU에서 최대 4배 더 빠른 추론(inference)을 제공하며, 속도가 중요한 대화형 로컬 워크플로우를 탐색할 수 있는 문을 엽니다.
텍스트 확산(text diffusion), 즉 텍스트 생성에 있어 매우 빠른 접근 방식을 탐구하는 실험적 오픈 모델인 DiffusionGemma를 소개합니다. Apache 2.0 라이선스로 출시된 이 26B Mixture of Experts (MoE) 모델은 일반적인 자기회귀(autoregressive) 대규모 언어 모델 (LLMs)의 순차적인 토큰 단위(token-by-token) 처리를 넘어섭니다. 대신, 텍스트 전체 블록을 동시에 생성하여 GPU에서 최대 4배 더 빠른 텍스트 생성을 제공합니다.
Gemma 4 제품군의 업계 선도적인 파라미터당 지능(intelligence-per-parameter)과 최첨단 Gemini Diffusion 연구를 기반으로 구축된 DiffusionGemma는 생성 속도를 극대화하도록 설계된 새로운 확산 헤드(diffusion head)를 통합합니다. 자기회귀(autoregressive) Gemma 4 모델이 고품질 프로덕션 출력의 표준으로 남아 있는 반면, DiffusionGemma는 인라인 편집(in-line editing), 빠른 반복(rapid iteration), 비선형 텍스트 구조 생성과 같이 속도가 중요한 대화형 로컬 워크플로우를 탐구하는 연구자와 개발자를 위해 설계되었습니다.
개발자를 위한 새로운 가치 창출
실시간 대화형 AI 애플리케이션을 구축하는 개발자들은 종종 로컬 추론(local inference)의 지연 시간(latency) 병목 현상으로 어려움을 겪습니다. DiffusionGemma는 몇 가지 주요 트레이드오프(trade-offs)와 함께 이러한 과제를 직접적으로 해결합니다:
- 매우 빠른 추론 (Blazing fast inference): 디코딩 병목 현상(bottleneck)을 메모리 대역폭(memory-bandwidth)에서 연산(compute)으로 전환함으로써, DiffusionGemma는 전용 GPU에서 최대 4배 더 빠른 토큰 출력을 생성합니다. (단일 NVIDIA H100에서 초당 1,000개 이상의 토큰, NVIDIA GeForce RTX 5090에서 초당 700개 이상의 토큰 생성).¹
- 접근 가능한 하드웨어 요구 사양 (Accessible hardware footprint): 총 26B 규모의 전문가 혼합 (Mixture of Experts (MoE)) 모델로서 추론 시에는 3.8B 파라미터만 활성화하므로, 양자화(quantized)를 거치면 고성능 소비자용 전용 GPU의 18GB VRAM 제한 내에 여유롭게 들어옵니다.
- 양방향 어텐션 (Bi-directional attention): 매 순전파(forward pass)마다 256개의 토큰을 병렬로 생성하여 모든 토큰이 다른 모든 토큰을 참조(attend)할 수 있게 합니다. 이는 인라인 편집(in-line editing), 코드 인필링(code infilling), 아미노산 서열 또는 수학적 그래프와 같은 비선형 도메인에서 상당한 이점을 제공합니다.
- 지능형 자기 수정 (Intelligent self-correction): 모델이 자신의 출력을 반복적으로 정제하여, 전체 텍스트 블록을 한 번에 평가하고 실시간으로 오류를 수정할 수 있습니다.
- 실험적 상태 및 프로덕션 권장 사항 (Experimental status & production recommendations): 속도와 병렬 레이아웃 생성에 우선순위를 두기 때문에, DiffusionGemma의 전반적인 출력 품질은 표준 Gemma 4보다 낮습니다. 최대 품질을 요구하는 애플리케이션의 경우, 표준 Gemma 4를 배포할 것을 권장합니다.
미세 조정 (fine-tuning)을 통해 특정 작업에 대한 DiffusionGemma의 성능을 향상시킬 수 있습니다. 아래 예시에서 Unsloth는 DiffusionGemma를 스도쿠(Sudoku)를 풀도록 미세 조정했습니다. 스도쿠는 각 토큰이 미래의 토큰에 의존하기 때문에 자기회귀 (autoregressive) 모델들이 어려움을 겪는 작업입니다. DiffusionGemma의 양방향 어텐션 (bi-directional attention)은 이 작업을 훨씬 더 쉽게 만듭니다.

스도쿠 (Sudoku) 문제를 해결하는 파인튜닝된 (Fine-tuned) DiffusionGemma.
왜 텍스트에 확산 (diffusion) 모델을 사용하는가?
AI 연구 커뮤니티는 수년간 확산 기반 (diffusion-based) 텍스트 생성을 탐구해 왔지만, 이를 대규모 모델에 적용하는 것은 여전히 과제로 남아 있었습니다. DiffusionGemma는 모델이 하드웨어를 사용하는 방식을 전환함으로써 이를 변화시킵니다.
전통적인 모델과의 트레이드오프 (trade-off)
대부분의 언어 모델은 타자기처럼 작동하며, 왼쪽에서 오른쪽으로 한 번에 하나의 토큰 (token)을 생성합니다. 클라우드 환경에서는 서버가 수천 개의 사용자 요청을 함께 배치 (batch) 처리하여 하드웨어 부하를 공유할 수 있기 때문에 이것이 효율적입니다. 하지만 단일 사용자를 위해 로컬에서 실행할 때, 이러한 단어 단위의 프로세스는 전용 GPU 또는 TPU를 제대로 활용하지 못하게 만듭니다. 즉, 프로세서가 다음 "키 입력"을 단순히 기다리는 데 대부분의 시간을 소비하게 됩니다.
DiffusionGemma는 이러한 비효율성을 역전시킵니다. 단어를 순차적으로 예측하는 대신, 256개 토큰으로 구성된 문단 전체를 동시에 초안으로 작성합니다. 컴퓨터 프로세서에 한 번에 더 큰 덩어리의 작업을 부여함으로써, DiffusionGemma는 하드웨어의 잠재력을 최대한 활용합니다. 이는 모델 추론 (inference)을 단일 순차적 타자기에서, 전체 텍스트 블록을 동시에 찍어내는 거대한 인쇄기로 업그레이드하는 것과 같습니다.
controls
loop
muted
autoplay
playsinline
width="100%"
style="border-radius: 8px; display: block; margin-bottom: 0; padding-bottom: 0px;"
aria-label="Hugging Face의 DiffusionGemma text-to-3D SVG 데모. 시각화를 위해 속도를 늦춘 단계별 생성 과정.">
귀하의 브라우저는 비디오 태그를 지원하지 않습니다.
Hugging Face의 DiffusionGemma text-to-3D SVG 데모. 단계별 생성.
이는 DiffusionGemma의 속도 향상이 로컬 및 저동시성 추론 (low-concurrency inference)을 위해 설계되었음을 의미합니다. 높은 QPS (Queries Per Second)를 요구하는 클라우드 서빙 (cloud serving) 환경에서는, 연산 자원을 효율적으로 포화시키기 위해 자기회귀 모델 (autoregressive models)을 배포할 수 있으므로, DiffusionGemma의 병렬 디코딩 (parallel decoding)은 수익 체감의 법칙이 적용되어 오히려 더 높은 서빙 비용을 초래할 수 있습니다. 처리량 (throughput)의 이점은 단일 가속기 상에서 낮거나 중간 정도의 배치 크기 (batch sizes)일 때 가장 강력합니다.
텍스트 확산 (text diffusion)의 작동 원리
시각적 노이즈에서 시작하여 이를 반복적으로 정제하여 선명한 그림을 만드는 AI 이미지 생성기와 유사하게, DiffusionGemma는 이를 텍스트에 적용합니다:
- 캔버스 (The canvas): 모델은 무작위 플레이스홀더 토큰 (placeholder tokens)으로 구성된 캔버스에서 시작합니다.
- 반복적 정제 (Iterative refinement): 모델은 여러 번의 패스 (passes)를 수행하며, 올바른 토큰을 고정하고 이를 문맥 힌트로 사용하여 나머지 부분을 정제합니다.
- 최종 다듬기 (Final polish): 텍스트가 고품질 출력물로 수렴합니다.

모델이 생성하는 동안 문단 전체를 처리할 수 있기 때문에, 복잡한 마크다운 (markdown) 형식을 완벽하게 닫거나 코드를 거의 실시간으로 생성 및 렌더링하는 것과 같은 새로운 모델 동작 패턴을 가능하게 합니다.
지금 바로 시작하기
-
가중치 (weights) 다운로드: 지금 바로 Hugging Face에서 실험적 모델 가중치(허용 범위가 넓은 Apache 2.0 라이선스로 출시됨)에 접근하세요.
-
선호하는 개발 도구 사용: MLX, vLLM (Red Hat의 통합 지원 포함), 그리고 Hugging Face Transformers를 사용하여 모델을 효율적으로 서빙하세요. 신속한 실험을 위해, 구성 가능성(composability)을 위해 설계된 모듈형 JAX 툴박스인 Hackable Diffusion을 사용한 미세 조정(fine-tuning) 튜토리얼을 출시합니다. 또한 Unsloth 및 NVIDIA NeMo를 통한 미세 조정을 탐색할 수 있습니다. 아울러, llama.cpp에 대한 공식 지원도 곧 예정되어 있습니다.
-
최적화된 성능 경험: 우리는 NVIDIA와 협력하여 그들의 하드웨어 스택 전반에 걸쳐 최적화를 진행했습니다. 이를 통해 소비자용 설정(GeForce RTX 5090 및 4090 GPU용으로 양자화됨)과의 호환성을 보장하는 동시에, 엔터프라이즈 시스템(고급 NVFP4 커널을 사용하는 Hopper 및 Blackwell)에서의 높은 성능을 보장합니다. 여기에는 로컬 데스크사이드 배포를 위한 NVIDIA DGX Spark 및 DGX Station, 그리고 AI 전문가를 위한 RTX PRO가 포함됩니다. NVFP4 (4비트 부동 소수점)에 대한 네이티브 지원은 연산 처리량(compute throughput)을 가속화하여, 모델이 거의 손실 없는 정확도로 더 빠른 속도로 실행될 수 있도록 합니다.
-
원하는 방식으로 시도: 데스크톱 전용 GPU에서 실행하거나, Gemini Enterprise Agent Platform Model Garden 또는 NVIDIA NIM을 통해 클라우드에서 실행하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기