Qwen-Image-2.1-Turbo는 7B가 아니다: 로컬에서 실행하는 데 실제로 필요한 VRAM
요약
본 기사는 Qwen-Image-2.1-Turbo 모델이 단순히 '7B'로 불리는 오해를 해소하고, 로컬 환경에서 실제로 필요한 VRAM 용량을 분석합니다. 전체 파이프라인은 16.2B 개의 파라미터를 가지며, 특히 비전-언어 인코더가 상당한 메모리를 차지함을 강조합니다. 또한 ComfyUI와 diffusers를 사용한 실행 방법 및 설정상의 함정(gotchas)을 다룹니다.
핵심 포인트
- Qwen-Image-2.1-Turbo의 '7B'는 디노이저 단독 파라미터일 뿐입니다.
- 전체 파이프라인은 16.2B 개의 파라미터를 가지며, VRAM 요구량이 높습니다.
- 로컬 실행 시 ComfyUI와 diffusers 사용법 및 최적화 방법을 다룹니다.
- 텍스트 인코더는 오프로드하거나 양자화하여 메모리 효율을 높일 수 있습니다.
Qwen-Image-2.1-Turbo는 어디서든 '7B' 모델이라고 불립니다. 로컬에서 실행해 보기 전에, Hugging Face 리포지토리가 32.4 GB이며, 번들된 텍스트 인코더가 이미지 모델보다 크고, 라이선스가 유료 사용을 금지한다는 것을 알아야 합니다.
Qwen은 기본 Qwen-Image-2.1 출시 후 19일 뒤인 2026-10-09에 Qwen-Image-2.1-Turbo를 공개했습니다. 이것은 8개의 디노이징(denoising) 단계에서 이미지 생성 및 편집을 수행하는 가속화된 체크포인트입니다. 기본 모델의 기본값은 40입니다. 제가 변경된 사항, 실제로 필요한 VRAM 양, diffusers와 ComfyUI로 실행하는 방법, 그리고 'poor results in comfy'라는 스레드를 이미 시작하게 만든 두 가지 설정상의 함정(gotchas)에 대해 다루겠습니다.
Qwen-Image-2.1 대비 변경된 사항
아키텍처에는 큰 변화가 없습니다. 모델 카드에는 Turbo가
참고로, LightX2V의 RTX 5090 표에서 가져온 기본 모델 수치들은 다음과 같습니다: 1024×1024 해상도에서 5.586초, 2048×2048 해상도에서 30.333초가 소요되었으며, 두 경우 모두 CFG를 비활성화하고 40단계를 사용했습니다. Turbo 모델은 이보다 훨씬 짧게 나와야 하지만, NVIDIA 하드웨어에서는 Turbo 수치를 찾을 수 없었습니다. 제가 찾은 유일한 실제 하드웨어의 Turbo 수치는 네이티브 Mac 포트 작성자(HF discussion #5)로부터 나온 것으로, M1 Pro와 16 GB 메모리에서 1024² 해상도 기준으로 약 120초가 소요되었습니다.
'7B' 수치가 다운로드 용량의 대부분을 숨긴다
제 연구용 컴퓨터에는 GPU가 없어 생성 시간을 측정할 수 없었습니다. 대신 Hub에서 모든 구성 요소의 safetensors 헤더를 직접 읽어왔고(전체 다운로드는 아니며 범위 요청만 함), 파라미터를 합산했습니다:
| 구성 요소 | 파라미터 | BF16 파일 크기 |
|---|---|---|
| Transformer (DiT, 32 레이어) | 7.115B | 14.23 GB |
| ... |
The '7B'는 디노이저(denoiser) 단독의 파라미터일 뿐입니다. 전체 파이프라인은 16.2B 개의 파라미터를 가지며, 그 절반 이상은 프롬프트와 참조 이미지를 인코딩하는 비전-언어 모델(vision-language model)입니다. 이것이 이 모델의 VRAM 추정치가 제각기 다른 이유이기도 합니다.
vLLM-Omni가 레시피에서 측정한 기본 모델은 동일한 아키텍처를 가지고 있으며, 1024×1024 해상도에서 BF16 기준으로 GB300에서 최대 34.0 GB가 필요했습니다. 이는 무언가를 오프로드(offload)하지 않는 한 32 GB RTX 5090이 담을 수 있는 용량보다 많습니다.
각 정밀도별 필요한 VRAM 양
텍스트 인코더는 프롬프트당 한 번 실행되는 반면, DiT는 매 단계마다 실행됩니다. 따라서 인코더를 오프로드하거나 강력하게 양자화(quantize)하여 거의 손실 없이 사용할 수 있습니다.
다음은 Comfy-Org/Qwen-Image-2.1와 unsloth/Qwen-Image-2.1-Turbo-GGUF의 파일 크기를 사용하여 실용적인 조합에 대한 가중치 총합입니다:
| Setup | DiT | Text encoder | VAE | Weights total |
|---|---|---|---|---|
| Full BF16 (diffusers default) | 14.23 GB | 17.53 GB | 0.68 GB | 32.44 GB |
| ... | ||||
| 이것들은 가중치 크기이며 측정된 피크 값은 아닙니다. 활성화(Activations)가 추가되며, 네이티브 2K에서는 매우 커집니다. ComfyUI와 diffusers는 두 모델을 스왑하여 메모리에 넣고 빼기 때문에, 작은 카드에서 중요한 것은 대략 DiT에 활성화를 더한 크기입니다. |
제 경험상 가이드:
- 40 GB 이상 카드: 모든 것을 BF16으로 실행하고 상주(resident)시킵니다.
- 24–32 GB: 텍스트 인코더를 오프로드한 BF16 DiT, 또는 INT8 Comfy 파일.
- 12–16 GB: DiT의 GGUF Q4_K_M부터 Q8_0까지 사용하고, 4비트 인코더와 오프로드를 활용합니다.
- Apple silicon, 16 GB: Siliconed 앱(Swift/Metal)은 전체 가중치, Comfy의 int8, 또는 Q4_K_M을 지원합니다.
양자화 품질에 관해서는: Unsloth가 BF16 Turbo 트랜스포머를 대상으로 LPIPS를 발표했습니다 (낮을수록 좋음). Q8_0 점수는 0.036, Q4_K_M은 0.153, Q2_K는 0.374입니다. 그들은 대부분의 GPU에 Q4_K_M을 권장하며, 2비트 및 3비트 파일이
첫 번째 주의사항: num_inference_steps만으로는 아무런 효과가 없습니다. 카드에 명시되어 있듯이, "설정된 num_inference_steps만으로는" 저장된 스케줄을 덮어쓰지 않습니다. 다른 단계 수를 시도하려면 반드시 sigmas=를 명시적으로 전달해야 하며, Qwen은 다른 스케줄들은 "평가되지 않았다"고 언급합니다. 만약 4단계로 시도했는데 결과물이 변하지 않았다면 그것이 이유입니다.
편집을 위해서는 동일한 파이프라인에 image=load_image(...).convert("RGBA")를 전달하세요. 접두사 KV 캐시(use_kv_cache=True)는 프롬프트와 참조 이미지를 한 번 인코딩하여 8단계 전체에서 재사용합니다.
ComfyUI에서 '뭉개짐' 없이 실행하는 방법
ComfyUI는 처음부터 Qwen-Image-2.1을 네이티브로 지원해 왔습니다. Comfy-Org/Qwen-Image-2.1에서 다음 파일들을 models/ 폴더에 넣어주세요:
diffusion_models/qwen_image_2.1_turbo_bf16.safetensors(또는_int8_convrot)text_encoders/qwen3vl_8b_bf16.safetensors(또는_int8_convrot/_w4a8)vae/qwen_image_2.1_vae_bf16.safetensors
공식 text-to-image 워크플로우부터 시작하세요.
두 번째 주의사항: 8단계의 일반 KSampler는 Turbo의 스케줄을 재현하지 못합니다. discussion #4에서 제시된 해결책("comfy에서 결과가 좋지 않은 사용자들을 위해")은 SamplerCustomAdvanced로 전환하고, 여기에 ManualSigmas 노드를 다음 값으로 설정하는 것입니다:
1.0, 0.978453, 0.95418, 0.926626, 0.89508, 0.845148, 0.704534, 0.414568, 0.0
euler와 CFG 1을 사용하세요. 이 노드를 서브그래프로 저장하여 매번 다시 입력할 필요가 없도록 하세요.
기본 모델이 이미 있다면, Comfy-Org는 Turbo에서 추출한 qwen_image_2.1_turbo_lora_avg_rank_178_bf16.safetensors (0.91 GB)도 제공합니다. 14 GB짜리 체크포인트를 두 번째로 다운로드하는 대신, 이를 기본 DiT에 적용할 수 있습니다.
라이선스가 실제 헤드라인입니다
2025년 8월의 원래 Qwen-Image는 Apache-2.0이었습니다. Qwen-Image-2.1과 Turbo는 '비상업적 목적(FOR NON-COMMERCIAL PURPOSES ONLY)'에만 권한을 부여하고 비상업적인 것을 '연구 또는 평가 목적으로만'으로 정의하는 Qwen Research License Agreement를 사용합니다. 상업적 이용의 경우 [email protected]으로 이메일을 보내 문의해야 합니다. 분쟁은 중국 법에 따라 항저우(Hangzhou) 법원에서 다뤄집니다.
Turbo 가중치가 올라온 같은 날, Qwen은 Alibaba Cloud Model Studio에서 유료 Pro 및 Turbo API도 출시했습니다. 계획했든 안 했든 결과는 이렇습니다. 집에서 무료로 실행할 수 있지만, 제품에 넣으려면 Alibaba에 돈을 지불해야 합니다.
그렇다면 Midjourney를 대체할 수 있을까요? 개인적인 작업과 실험의 경우, 좋은 텍스트 렌더링, 네이티브 투명도, 다중 이미지 참조 기능을 갖춘 8단계 모델은 강력한 제안입니다. 클라이언트 작업을 위해서는 무엇을 취소하기 전에 라이선스를 읽어보세요.
Qwen-Image-2.1-Turbo를 로컬에서 실행할 가치가 있을까요?
VRAM이 16GB 이상이고 텍스트가 많은 포스터, UI 목업 또는 투명 자산을 시도해 보고 싶다면, 네, 그렇습니다. Q8_0 또는 INT8을 사용하여 시그마(sigmas)를 올바르게 설정하세요. 깨끗한 상업적 권리가 필요하다면, Apache 라이선스가 적용된 2025년의 Qwen-Image가 여전히 배포할 수 있는 모델입니다.
Turbo가 8단계로 실제로 유료 이미지 서비스를 대체했나요? 아니면 이미지 품질이 중요해지기도 전에 비상업적 라이선스 규칙 때문에 불가능한 건가요? 사용하신 GPU, 양자화(quant), 그리고 이미지당 소요 시간을 댓글에 남겨주세요. 제가 적절한 Turbo 벤치마크를 어디에서도 찾지 못했기 때문에, 여러분의 경험이 최초 기록이 될 것입니다.
출처
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기