
뉴럴 네트워크를 '짐니트(Jimnit)' 하기: 이미지 내부의 텍스트를 수정하는 Qwen Image Edit Plus
요약
Alibaba의 Qwen Image Edit Plus 모델을 통해 텍스트 명령만으로 이미지 내 텍스트를 정밀하게 수정하는 기술을 소개합니다. 배경과 조명을 유지하며 글자만 바꾸는 '짐니트(jimnit)' 개념과 Qwen 모델의 작동 원리를 분석합니다.
핵심 포인트
- Qwen Image Edit은 의미론적 수정과 외형적 수정을 모두 지원함
- 텍스트 명령만으로 레이어나 마스크 없이 이미지 세부 사항 합성 가능
- Qwen2.5-VL과 VAE-엔코더를 결합하여 장면과 외형을 동시에 처리
- 러시아어 등 특정 언어 처리에는 기술적 한계가 존재함
프로모션 배너에 "50% 할인"이라고 적혀 있는데, 행사가 30%로 줄어들었습니다. 원본 파일은 유실되었고, 디자이너는 휴가 중이며, 포토샵은 없습니다. 예전 같았으면 폰트와 씨름하며 밤을 지새워야 했을 상황입니다. 2026년에는 뉴럴 네트워크(Neural Network)로 이런 문구를 '짐니트(jimnit)' 합니다. 이미지를 업로드하고 문장 하나를 작성하면, 배경, 조명, 글꼴의 형태는 그대로 유지된 채 새로운 텍스트가 삽입된 파일을 얻을 수 있습니다.
이 동사는 Gemini에서 유래되었습니다. Google의 Nano Banana라는 별명을 가진 모델이 출시된 이후, 사람들은 모든 것을 "짐니트(jimnit)" 하기 시작했습니다. 누군가는 "GPT(джпти)"라고 말하기도 하지만 본질은 같습니다. 레이어나 마스크 없이 텍스트 명령만으로 완성된 이미지에 세부 사항을 합성하는 것입니다. 이 유행에는 이름과 주소가 있는 도구가 있습니다: 바로 Alibaba의 오픈 모델(Open Model) 호스팅 버전인 Qwen Image Edit Plus입니다. 아래에서는 이 도구가 무엇을 할 수 있는지, 비용은 얼마인지, 그리고 약점은 무엇인지 분석합니다. 스포일러를 하자면, 러시아어 텍스트 처리는 꽤 까다롭습니다.
해외 카드가 없다면 러시아에서 Gemini를 사용하는 것은 불가능하며, Alibaba Cloud 계정 생성은 결제 방식 때문에 별도의 퀘스트와 같습니다. 실질적으로 세 가지 방법이 있습니다: 타인의 해외 카드 사용, 추가 비용이 발생하는 리셀러(Reseller), 그리고 provod.ai (러시아의 OpenRouter)와 같은 애그리게이터(Aggregator)를 사용하는 것입니다. 이곳에서는 Qwen이 GPT 및 Gemini와 함께 하나의 채팅창에 존재하며, 러시아 은행 카드로 결제할 수 있습니다. 이제 2026년 7월 기준 가격과 제한 사항을 포함한 모델에 대해 알아보겠습니다.
이미지를 "짐니트(jimnit)" 한다는 의미와 Qwen의 역할
요약하자면: "짐니트(jimnit)"란 텍스트 명령으로 이미지를 수정하는 것을 의미합니다. 이 단어는 Gemini 2.5 Flash Image에서 유래되었으며, Qwen Image Edit은 프레임 내부의 텍로에 중점을 두어 동일한 유형의 과제를 해결합니다.
2025년 8월 26일, Google은 'Nano Banana'로 알려진 Gemini 2.5 Flash Image를 출시했습니다. 이 모델은 (Tech-Now 리뷰에 따르면) 문구 하나만으로 글자를 포함한 정밀한 수정을 수행할 수 있어 유명해졌습니다. 2025년 11월에는 Gemini 3 Pro Image를 기반으로 텍스트 렌더링과 4K에 중점을 둔 Nano Banana Pro가 출시되었습니다. 이로 인해 러시아어권 사용자들 사이에서 'khano banan neyroset' (하노 바난 신경망)과 같은 검색어가 등장했는데, 이는 일부 러시아 인터넷 사용자들이 별명을 음차하여 표기한 것입니다. 해당 모델의 가격은 2차 출처를 통해 떠돌고 있으나, 공식적인 원천 소스를 통해 확인할 수 없으므로 여기에는 수치를 기재하지 않습니다.
이와 병행하여, 2025년 8월 19일 Qwen 팀은 편집을 위한 20B 모델인 Qwen-Image-Edit을 선보였습니다 (Qwen 공식 블로그). 입력 이미지는 두 가지 경로로 전달됩니다: 장면의 의미(semantic)는 Qwen2.5-VL이 담당하고, 외형(appearance)은 VAE-엔코더 (VAE-encoder)가 담당합니다. 이에 따라 두 가지 유형의 수정이 가능합니다: 의미론적 수정 (장면, 포즈, 구도 변경)과 외형적 수정 (색상, 세부 사항, 글자 변경). 우리는 후자에 주목합니다.
Qwen Image Edit의 글자 수정 능력
요약하자면: 이미지 내부의 중국어와 영어 텍스트를 추가, 삭제 및 교체하며, 폰트(font), 크기 및 스타일을 최대한 유지하려고 시도합니다 (Qwen 블로그, 2025년 8월).
작동 방식은 다음과 같습니다: 모델이 기존의 글자를 읽고, 이를 지운 뒤, 동일한 서체와 기울기를 재현하여 새로운 글자를 씁니다. 9월 버전인 Qwen-Image-Edit-2509는 여기서 더 나아갔습니다: Hugging Face의 카드에 따르면, 글자의 내용뿐만 아니라 글꼴, 색상, 재질까지 변경할 수 있습니다. 예를 들어 평면적인 인쇄를 입체적인 금속이나 네온 효과로 바꿀 수 있습니다. 모델은 프롬프트(prompt)가 제한 범위 내에 있다면 완전히 새로운 문장을 만들어낼 수도 있습니다.
Qwen-Image 기술 보고서(arXiv:2508.02324, 2025년 8월)의 수치들은 왜 텍스트가 중요한지를 설명합니다. LongText-Bench에서 기본 모델은 중국어 긴 문장을 94.6%의 정확도로 렌더링하며, 이는 GPT Image 1 [High]의 61.9%와 대조됩니다. 영어 결과는 0.943으로 측정된 수치 중 최고치입니다. CVTG-2K에서 영어 단어 정확도는 82.88%로, Seedream 3.0의 59.24%보다 높고 GPT Image 1의 85.69%보다는 낮습니다. 표는 Hyper.ai의 분석을 바탕으로 대조되었습니다. 이 결과들은 기본 Qwen-Image에 해당하며 제품군에 대한 간접적인 지표로만 활용됩니다. 보고서에서 키릴 문자는 테스트되지 않았습니다. 이 부분을 기억해 두세요.
Edit, Plus, Max 또는 2.0 Pro: 어떤 버전을 선택해야 할까
요약하자면: API를 통해 문구를 수정하려면 qwen-image-edit-plus를 선택하세요. 이는 Alibaba Cloud Model Studio에서 사용하는 제품군 명칭입니다. 나머지 버전들은 더 산업적인 작업이나 최신 생성 작업을 위한 것입니다.
Model Studio의 안정적인 스냅샷(snapshot)은 2025-10-30 기준이며, 목록에는 더 최신인 2025-12-15 버전도 있습니다 (문서 확인일: 2026-07-19). Plus 시리즈의 제한 사항은 다음과 같습니다: 요청당 13개의 입력 이미지, 16개의 출력 이미지, 출력 형식은 PNG, 너비와 높이는 각각 512-2048 px 범위입니다.
제품군은 계속 확장되고 있습니다. 2026년 2월 10일, 생성과 편집을 하나의 모델로 통합한 Qwen-Image-2.0이 출시되었습니다 (QwenLM 리포지토리). 현재 Model Studio에서는 2026-03-03, 2026-04-22 및 최신 2026-06-22 스냅샷을 포함하는 qwen-image-2.0-pro를 권장하며, qwen-image-edit-max (스냅샷 2026-01-16)는 산업 디자인, 기하학적 추론(geometric reasoning) 및 캐릭터 일관성(character consistency)을 위해 포지셔닝되어 있습니다.
| 버전 | 스냅샷 | 용도 |
|---|---|---|
| qwen-image-edit-plus | 2025-10-30 (안정형), 2025-12-15 | 이미지 내 텍스트 및 객체 수정, 입력 1-3개, 출력 1-6개, PNG 512-2048 px |
| ... | ||
| Model Studio 문서 및 QwenLM 리포지토리 기준, 2026-07-19 확인. |
선택은 간단합니다. 문구 수정 및 세부적인 작업에는 Plus로 충분하며, 이후에는 이 버전을 중점적으로 살펴볼 것입니다. 최신 2.0 Pro는 이미지를 처음부터 생성해야 할 때 의미가 있습니다.

문구를 변경하는 방법: 무료 채팅 또는 API
요약하자면: 코딩 없이 사용하려면 chat.qwen.ai의 Qwen Chat 웹 애플리케이션에 있는 Image Editing 기능을 사용하면 됩니다. 대량으로 처리하거나 직접 만든 스크립트를 사용하려면 API를 통해 가능합니다.
첫 번째 방법은 일회성 작업에 적합합니다. Qwen Chat을 열고 Image Editing을 찾은 뒤, 클립 아이콘을 클릭합니다. 이는 요청에 사진을 첨부하는 가장 쉬운 방법이며, 스마트폰에서도 원본 파일을 업로드할 수 있습니다. 그다음 무엇을 변경할지 작성하면 됩니다. 상품 카드의 경우 "동일한 카드를 보여주되 가격표를 1990으로 바꿔줘"와 같은 일상적인 문구로도 충분합니다. 모델은 최신 버전을 사용하며 비용은 들지 않습니다.
두 번째 방법은 API입니다. Gate.AI의 경우 multipart/form-data와 n, size, response_format 파라미터를 사용하는 OpenAI 호환 엔드포인트(endpoint) /images/edits를 제공합니다 (Gate.AI 설명, 2026년 7월 기준). 공식 API Model Studio의 제한 사항은 다음과 같습니다: 지원 형식은 JPG, JPEG, PNG, BMP, TIFF, WEBP 및 GIF이며, 파일 크기는 최대 10MB, 권장 측면 길이는 384-3072px입니다. 프롬프트(prompt)는 중국어 또는 영어로 최대 800 토큰까지 가능하며, 부정 프롬프트(negative_prompt)는 최대 500자까지 가능합니다. 또한 시드(seed) 설정이 가능하며, 프롬프트 자동 확장 기능인 prompt_extend가 기본적으로 활성화되어 있습니다 (문서 기준, 2026년 7월 19일 확인).
작업 순서:
- 원본 준비: 명확한 문구, 대비가 뚜렷한 배경, 10MB 이하의 파일.
- 영어로 프롬프트 작성: 무엇을 지울지, 무엇을 쓸지, 글꼴(font)을 유지할지 여부.
- n 값을 2에서 6 사이로 설정하고 해상도를 512-2048px 범위 내로 지정합니다. 성공적인 결과물을 반복하기 위해 시드(seed)를 고정하고, 불필요한 요소를 방지하기 위해 부정 프롬프트(negative_prompt)를 조절하며 테스트합니다.
- 결과물을 즉시 다운로드: 링크는 24시간 동안만 유효하며 그 이후에는 파일이 사라집니다 (Model Studio 문서 기준).
실제 호출 코드는 몇 줄로 구성됩니다:
curl -X POST "https://api.provod.ai/v1/images/edits" \
-H "Authorization: Bearer $PROVOD_KEY" \
-F "model=qwen-image-edit-plus" \
...
이 모든 파이프라인은 러시아에서도 단 두 줄의 코드, 즉 키(key)와 provod.ai의 통합 API base_url을 변경하는 것만으로 작동합니다. 이 API는 OpenAI-SDK와 호환되므로 /images/edits 경로에 해당하는 코드를 다시 작성할 필요가 없습니다. 배너를 위한 슬로건 20가지를 만드는 것과 같은 텍스트 작업 또한 동일한 잔액(balance)을 사용하는 채팅 모델을 통해 해결할 수 있습니다.
모델이 러시아어 텍스트를 처리할 수 있을까
요약하자면: 공식적으로는 '아니오'입니다. Alibaba Cloud의 FAQ에는 간체 중국어와 영어를 지원한다고 명시되어 있으며, 다른 언어도 시도해 볼 수는 있지만 품질은 보장되지 않는다고 되어 있습니다 (2026년 7월 19일 확인 기준).
저는 오히려 이러한 유보 조항이 반갑습니다. 벤더(vendor)가 랜딩 페이지의 화려한 약속 대신 한계를 솔직하게 명시하고 있기 때문입니다. 키릴 문자(Cyrillic)를 위한 실질적인 전략은 다음과 같습니다. 'СКИДКА'(할인), 'НОВОЕ'(신상), 'ОТКРЫТО'(오픈)와 같이 2~5글자의 짧은 단어를 요청하세요. n=4로 설정하고 각 결과물을 눈으로 직접 확인해야 합니다. 모델이 글자를 혼동하거나 글자와 유사한 기호를 그릴 수 있기 때문입니다. 긴 문구는 두 번의 호출로 나누어 처리하세요. 그리고 예비 계획을 세워두는 것이 좋습니다. 위의 벤치마크(benchmark) 결과에서 알 수 있듯이, 모델은 영어 텍스트를 훨씬 더 안정적으로 그려냅니다.
문구 외에 무엇을 더 '짐니트(Jimnit)' 할 수 있을까
요약하자면: 동일한 모델로 여러 사진을 합성하거나, 오래된 사진을 복원하고, 머리카락 색을 바꾸거나 조명을 변경할 수 있습니다. 2509 버전은 최대 3장의 이미지를 입력받을 수 있으며, ControlNet 맵인 depth, edge, keypoint를 이해합니다.
실제 업무 시나리오:
- 두 사진 온라인 합성: "사람+사람", "사람+상품", "사람+장면" 조합을 통해 판매자가 마켓플레이스 상품 카드를 위해 자신을 상품과 믹스할 수 있습니다. 서비스가 사진을 합성할 때는 1~3개의 원본이 최적입니다 (카드 2509).
- 오래된 가족 사진 복원: 긁힘 제거, 얼굴 보정, 흑백 사진을 컬러로 채색.
- 인물 사진의 머리카락 색상 변경 또는 광고 속 자동차 차체 색상 변경: 색상은 바뀌지만 질감(texture)은 유지됩니다.
- 사진 속 얼굴을 노인이나 아이로 변형: 밈(meme) 제작에 재미있고, 촬영 전 스타일을 시뮬레이션하는 데 유용합니다.
- 디테일 손실 없이 프레임 밝게 만들기: 어두운 인테리어를 밝게 하거나, 저녁에 찍은 상품 사진의 노출을 끌어올립니다.
- 계절에 맞춰 사진 변환: 여름 배경을 겨울 배경으로, 평범한 분위기를 축제 분위기로 변경.
- 재미 삼아 사진 속 인물을 근육질로 만들기: 프롬프트(prompt)가 명확하다면 모델이 조심스럽게 체형을 추가합니다.
모든 시나리오는 동일한 메커니즘을 따릅니다: 입력 이미지와 문구만 있으면 되며, 수동으로 마스크(mask)를 그릴 필요가 없습니다. 이는 그래픽 편집기를 전혀 열지 않고도 가격표와 같은 사소한 부분을 편집할 수 있는 진정한 지점입니다.
Qwen Image Edit Plus가 해결하지 못하는 것
요약하자면: 키릴 문자는 보장되지 않으며, 파일 크기는 10MB 이하로 제한됩니다. 결과물 링크는 24시간 동안만 유지되며, 모델은 작은 글꼴의 긴 문구를 혼동합니다. 결과 확인은 사용자의 몫입니다.
항목별로 자세히 살펴보겠습니다. 러시아어 텍스트는 공식적으로 지원 범위 밖이며, 이에 대해서는 위 섹션에서 언급했습니다. 입력 파일은 10MB 및 지정된 형식 목록으로 제한되어 있어 RAW 파일을 첨부할 수 없습니다. 완성된 이미지 링크는 24시간 후에 만료됩니다. 다운로드하는 것을 잊었다면 다시 생성하고 비용을 지불해야 합니다. 빌링(billing) 시스템은 성공적인 생성마다 비용을 차감하기 때문입니다 (Model Studio 문서 참조). 작은 글꼴과 긴 문자열은 모델이 오류와 함께 다시 작성합니다. 벤치마크(benchmark)에 따르면 복잡한 데이터셋에서 영어 단어조차 정확도가 최대 5분의 1까지 떨어지는 것을 볼 수 있습니다. 모든 결과물을 확인하십시오. 인용된 출처에는 Plus 모델로 반복 수정할 때 발생하는 성능 저하에 대한 별도의 측정치는 없습니다.
비용 및 러시아에서 모델을 호출하는 방법
요약: Gate.AI에서 qwen-image-edit-plus 호출 비용은 생성된 이미지당 $0.0287입니다 (가격 기준 - 2026년 7월). Model Studio는 성공적으로 생성된 이미지에 대해서만 비용을 청구합니다.
Alibaba Cloud의 빌링(Billing) 방식은 매우 직관적입니다. 실패한 호출은 과금되지 않으며, 성공한 호출은 개별 단위로 과금됩니다 (문서 기준, 2026년 7월 19일 확인). EvoLink의 2026년 1월 데이터에 따른 시장 가격 범위는 다음과 같습니다: Alibaba Cloud 직접 이용 시 이미지당 약 $0.025-0.035, FAL은 약 $0.028, WaveSpeed는 약 $0.029, Replicate는 약 $0.032입니다. 이 정보는 2차 자료이며 정확한 공식 가격을 확인할 수 없었으므로, 수치를 가격표가 아닌 참고용으로만 간주하십시오.
이제 러시아 관련 내용입니다. 러시아에서 Alibaba Cloud에 직접 결제하는 것은 별도의 모험이며, Gemini 계정 관리 또한 마찬가지입니다. 접근 조건, 결제 및 문서 작업에 관한 사항은 provod.ai 서비스 웹사이트에서 확인하십시오.
provod.ai가 적합하지 않은 경우
요약: 애그리게이터(Aggregator)는 접근 및 결제 문제를 해결해 줍니다. 하지만 벤더의 공식 계정, 로컬 실행 및 일회성 수정 작업의 경우에는 애그리게이터가 불필요한 시나리오가 됩니다.
Google의 애플리케이션 및 채팅 메모리가 포함된 공식 인터페이스가 필요하다면 직접 구독이 필요하며, 어떤 애그리게이터도 이를 재현할 수 없습니다. 만약 자신의 GPU에서 모델을 돌리고 싶다면, Qwen-Image-Edit-2509의 가중치(Weights)는 공개되어 Hugging Face에 올라와 있습니다: diffusers의 QwenImageEditPlusPipeline을 통해 실행할 수 있으며, 공식 예제는 bf16, 40 steps, true_cfg_scale 4.0을 사용합니다. 이 경우 비용이 전혀 들지 않습니다. 또한 "한 달에 이미지 두 장" 정도의 작업은 무료인 Qwen Chat으로 해결 가능합니다.
결론: 일회성 수정은 웹 채팅(Web-chat), 카드 뭉치 작업이나 자동화가 필요하다면 API를 사용하십시오. 러시아에서 두 번째 경로를 택하는 가장 짧은 방법은 루블화 잔액을 사용하는 애그리게이터를 통하는 것입니다.
Base URL과 키(Key)를 변경하면, 기사에서 언급된 것과 동일한 호출을 해외 카드 없이 제공업체의 가격에 따른 루블화 결제로 사용할 수 있습니다. 그다음은 프롬프트(Prompt)의 문제입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기