Qwen Image 2.1용 QR 코드 몬스터 LoRa 에디트
요약
Qwen Image 2.1을 활용하여 QR 코드와 같은 특정 요소를 포함하는 이미지 편집(Image edit) 워크플로우를 소개합니다. 이 모델은 고품질의 이미지 쌍으로 학습되어 원본 윤곽선을 유지하며 원하는 장면으로 이미지를 변환하는 데 효과적입니다.
핵심 포인트
- Qwen Image 2.1을 활용한 I2I 이미지 편집 기법 제시
- 원본 이미지의 모양과 윤곽선 유지가 핵심 기술
- QR 코드 등 특정 요소 처리 가능성 확인
이전에 사용되던 구형 SD 모델용 Controlnet 중 하나가 있었는데, 그 당시에는 매우 인기가 많았고 멋진 거의 착시 현상 같은 이미지를 만들 수 있었습니다. 이것은 동일한 개념이지만, 대신 저는 입력 이미지(input image)를 제공하고 원하는 장면을 생성하도록 요청하는 I2I Image edit 모델을 사용하고 있습니다.
Qwen Image 2.1 버전의 결과물에 매우 만족했습니다. 이 모델은 25쌍의 고품질 이미지 쌍으로 학습되었으며, 사람 주체(human subjects)를 사용하거나 데이터셋에 포함되지 않은 장면을 묘사할 때도 상당히 잘 작동합니다. QR 코드를 처리할 수는 있지만, 이것이 데이터셋의 주요 초점은 아니었기 때문에 실제 사용성/스캔 가능성 면에서는 성공적일 수도 있고 아닐 수도 있습니다.
제안된 프롬프트는 데이터셋에 캡션된 내용과 정확히 같습니다: 원본 이미지의 윤곽선과 모양을 유지하면서 전체 이미지를 <여기에 원하는 프롬프트>로 변환하세요(Transform the entire image into <your prompt here> while preserving the outlines and shapes of the original image)
복잡한 프롬프트와 간단한 프롬프트 모두에서 잘 작동하는 것 같습니다.
Civit에서 다운로드할 수 있습니다. 모든 이미지/비디오는 기본적으로 Ausboss의 픽셀 드리프트 수정 워크플로우(pixel drift fix workflow)에 몇 가지 추가적인 터치를 하고 viggle Turbo LoRa를 사용하는 방식으로 구성되어야 합니다. 제가 이곳에 게시하는 주된 이유는 여러분이 무엇을 창조해내는지 보고 싶기 때문입니다!
제출자: /u/cranpeach69
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/StableDiffusion의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기