ComfyUI 없이 로컬에서 Qwen-Image 2.1 Turbo 사용하기
요약
본 글은 로컬 추론 서버 Quartermaster를 사용하여 ComfyUI 없이 Qwen-Image 2.1 Turbo 모델을 구동하는 방법을 안내합니다. 사용자는 앱 내에서 필요한 DiT, VAE, 그리고 추가적인 LLM 파일을 다운로드하고, 각 모델에 맞는 설정을 적용하여 이미지를 생성할 수 있습니다.
핵심 포인트
- Quartermaster는 로컬 추론 서버로, stable-diffusion.cpp를 구동하며 다양한 기능을 제공합니다.
- Qwen-Image 2.1 Turbo 사용 시 DiT (GGUF), VAE, 그리고 LLM 파일을 준비해야 합니다.
- 투명 PNG 출력을 위해서는 'transparent' 체크와 RGBA VAE가 필요합니다.
- 모델 설정은 앱 내에서 필요한 스텝과 cfg 값을 자동으로 매칭할 수 있습니다.
저는 무료 오픈 소스 (MIT) 로컬 추론 서버인 Quartermaster의 개발자입니다. 이 앱은 stable-diffusion.cpp를 구동하며, 같은 앱에서 LLM, TTS 및 음성 인식(speech-to-text)도 제공합니다. 모델들을 사용하는 대로 VRAM 안팎으로 교체합니다. 모델들은 앱 내부에서 다운로드할 수 있습니다: Hugging Face에서 검색하고 양자화(quant) 버전을 선택하면 Quartermaster가 자체적으로 설정을 작성해 줍니다. 각 모델에 맞는 VAE와 텍스트 인코더를 매칭시키고 적절한 스텝과 cfg 값을 선택합니다. Qwen-Image 2.1 Turbo는 8 스텝과 cfg 1에서 작동하며, 실제 투명 PNG도 가능합니다: 'transparent'를 체크하면 RGBA VAE가 필요로 하는 정확한 프롬프트 문구가 추가됩니다. 2.1 Turbo를 실행하려면 내장 모델 브라우저에서 다음 세 가지 (권장 파일)를 가져오기만 하면 됩니다: DiT: Abiray/Qwen-Image-2.1-Turbo-GGUF (저는 Q8_0을 사용합니다), 2.1 VAE: qwen_image_2.1_vae_bf16.safetensors, 그리고 /u/OneMoreName1이 제출한 Qwen3-VL-8B-Instruct GGUF와 그 mmproj 파일입니다. [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기