Qwen-Image-2.1, 소형 고효율 통합 이미지 생성 모델
요약
본 글은 Qwen-Image-2.1과 같은 최신 이미지 생성 모델의 라이선스 문제, 성능 평가 및 로컬 환경에서의 활용 방안을 다룹니다. 특히 Stable Diffusion이나 FLUX.1-Kontext와 같은 모델들이 보여주는 인상적인 현장 사용 경험과, ComfyUI를 통한 간편한 로컬 구동 방법을 제시합니다.
핵심 포인트
- Qwen-Image-2.1 등 최신 이미지 모델은 라이선스 및 상업적 이용 제한에 유의해야 합니다.
- 로컬 환경에서 이미지를 생성하는 성능이 코드 생성보다 뛰어나다는 인상을 받았습니다.
- FLUX.1-Kontext는 사람/동물 사진을 선화로 변환하는 능력이 탁월하며 사용하기 편리합니다.
- ComfyUI를 활용하면 복잡한 설정 없이도 로컬 이미지·영상 모델 구동을 쉽게 시작할 수 있습니다.
마케팅에서 가중치 공개 모델을 오픈소스라고 부르는 건 흔한 왜곡임. 이제는 오픈소스 정의에 어긋나는 상업적 이용 제한까지 있으니, 엄밀히는 오픈 웨이트도 아니고 가중치 열람 가능(weights-available) 모델이라고 부르는 편이 정확함.
학습 자료에 GPL 자료가 조금이라도 들어갔을 거라는 데 돈을 걸 수 있으니, 나도 이 모델을 GPL로 취급하고 내 마음대로 쓰겠음. AI 연구소가 라이선스를 무시해도 된다면 우리도 마찬가지임.
나도 이 내용을 올리려던 참임. Apache 2.0을 쓰는 마지막 이미지 모델들은 2025년 모델로 보이며, 최근 Qwen 모델들은 비상업적 용도로만 사용할 수 있음.
현재 덜 제한적인 라이선스를 쓰는 최상위 이미지 모델에는 어떤 것들이 있나요?
첫인상으로는 프롬프트 지시를 잘 따르지 못함. 특정 도시에 유리로 만든 3D 글자를 배치해 달라고 했는데, 흰 배경에 깨진 3D 글자를 내놓았음. 시드를 바꾸면 나아질 수도 있겠지만, 안정적으로 결과를 얻기보다는 시행착오를 거쳐야 하는 느낌임.
Qwen과 Alibaba는 사실상 모든 모델의 강력한 경쟁자임. 최상위 모델 수준의 벤치마크 성적을 내면서 오픈소스에 집중하고, 경쟁사보다 훨씬 저렴함. 앞으로의 행보가 기대됨!
로컬 텍스트-이미지 생성 성능은 정말 인상적이며, 현재는 로컬 코드 생성보다 앞서 있다고 느낌. 로컬에서 몇 초 만에 이미지를 얻을 수 있고 품질도 기대보다 훨씬 높은 반면, 코드 생성은 훨씬 느리고 덜 인상적임.
이유가 있겠지만 AI 전문가는 아니라서 더 잘 아는 분들의 설명을 듣고 싶고, 지금까지 내가 직접 써보며 느낀 차이는 이러함.
Stable Diffusion 첫 출시 때부터 특별한 목적 없이 재미로 확산 모델을 종종 써왔음. 최근에는 사실상 CNC 재봉틀을 쓰는 친구 아내의 재봉 취미를 위해 간단한 벡터 이미지를 만들어 주고 있는데, MacBook Pro에서 mflux로 돌리는 FLUX.1-Kontext가 무척 인상적임.
사람이나 동물 사진을 선화로 바꿀 때, 다른 모델처럼 대충 비슷한 그림이 아니라 원래 대상임을 알아볼 수 있게 그려주는 능력이 탁월함.
이제는 구형 모델이지만 내가 알기로 텍스트 처리 기능도 내장돼 있으며, 여러 테스트에서 예전 모델들의 들쭉날쭉함 없이 원하는 결과를 안정적으로 내줌. 모델이 크고 느려서 M1 Max Mac 기준 512×512 이미지 편집에 약 3분이 걸리지만 쓰기 좋고, ComfyUI 같은 복잡한 실행 환경 없이도 설정이 간단함.
생성 모델에서 출력 품질은 필요조건이지 충분조건은 아님. 특히 시각적 표현에 필요한 어휘가 부족하면 프롬프트 준수 여부가 상당히 들쭉날쭉해짐.
코딩도 마찬가지로, 초급 개발자는 특정 인터페이스를 준수하거나 포인트프리 스타일로 리팩터링하도록 지시할 생각을 못 하곤 함. 다른 답글처럼, 이미지 쪽은 예술가가 더 잘 판단할 수 있음.
예술가라면 반대로 느낄 것 같음. 이미지에는 덜 감탄하고 코드 품질에는 더 감탄할 수 있음.
llama-server -m 을 쓰는 것처럼 이 모델을 로컬에서 실행하려면 어떻게 해야 하나요?
Python을 직접 쓰거나 상당 부분 의존하지 않으면서, 신경망을 최대한 효율적으로 실행하는 방법을 찾고 있음.
추가로 어느 정도 로컬 하드웨어가 필요한지도 궁금함. 매개변수 7B면 아주 가벼워 보이지만 확신은 없음.
이런 유형의 모델을 위한 difussion.cpp가 있음. 두 달 전 ChatGPT의 도움으로 krea-2-turbo를 설정했는데, 충분한 성능의 컴퓨터가 있다면 이 모델도 지원되는 대로 그 방법을 추천함.
연결된 GitHub 페이지에 Diffusers, ComfyUI, vLLM-Omni, SGLang, LightX2V 지원 여부와 각각의 링크가 나와 있음.
로컬 이미지·영상 모델을 시작하기에는 ComfyUI가 가장 쉬운 방법 중 하나일 것 같음. vLLM이 이미 지원한다면 vllm serve --omni --port 9080 같은 방식도 가능할 것임.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기