
누가 실제로 러시아어 프롬프트를 이해하는가: Kandinsky 5.0 대 GPT Image 2 및 Nano Banana 2
요약
이미지 생성 모델의 러시아어 프롬프트 이해 능력과 문화적 맥락 구현 방식을 분석합니다. Kandinsky 5.0의 네이티브 다국어 아키텍처와 GPT Image 2의 LLM 기반 프롬프트 재작성 방식의 차이점을 다룹니다.
핵심 포인트
- Kandinsky 5.0은 러시아 문화 코드가 포함된 데이터로 사전 학습된 네이티브 모델임
- GPT Image 2는 LLM을 통한 프롬프트 재작성(revised_prompt) 방식을 활용함
- 언어 이해(의미 구성)와 키릴 문자 출력(시각적 구현)은 서로 다른 과제임
- 모델의 성능은 단순 Elo 점수 외에 접근성과 문화적 맥락 반영 여부가 중요함
벤더의 "신경망이 러시아어를 이해한다"는 주장과 독립적인 측정 방식이 어떻게 다른지, 그리고 실제로는 접근성, 제한 사항, 그리고 양질의 이미지를 얻는 비용이 왜 모든 것을 결정하는지 분석합니다.
2026년 7월 기준, Artificial Analysis Image Arena의 블라인드 레이팅 상위권은 다음과 같습니다: GPT Image 2 (high) — 21,060회의 비교를 통해 Elo 1338 기록, 그 뒤를 이어 Reve 2.1 (1301), MAI-Image-2.5 (1269), Nano Banana 2 Lite 및 Nano Banana 2 (1262 및 1261) 순입니다. 상위 12위 안에 러시아 모델은 없습니다. 이 순위는 프롬프트 언어별 구분 없이 사람들의 블라인드 투표로 수집되었으며, 특정 모델이 없다는 것은 모델이 패배했다는 의미가 아니라 아레나(Arena)에 연결되지 않았음을 의미할 수 있습니다 (S01-1) (Text to Image Leaderboard, Artificial Analysis). Sber AI에서 Kandinsky 5.0의 책임자로 데니스 디미트로프(Denis Dimitrov)가 언급된 Sber 블로그에서는 해당 라인업이 "러시아어 및 영어 프롬프트로 네이티브하게 작동한다"고 주장했습니다 (Kandinsky 5.0, Habr/Sberbank). 이는 직접적인 논쟁 대상이 아닙니다. 하나는 블라인드 비교에서의 사람들의 평균적인 선호도에 관한 것이고, 다른 하나는 언어 아키텍처(Language Architecture)에 관한 것이기 때문입니다. "신경망이 러시아어로 사진을 만들게 하기"라는 요청은 이 두 가지 과제를 혼합하고 있습니다. 따라서 "신경망이 사진을 만들게 하기"는 단일 모델의 이름이 아니라, 먼저 필요한 결과물(사실주의, 스타일 제어 또는 러시아어 프롬프트)을 선택해야 하는 이유가 됩니다.
키릴 문자와 의미 이해는 동일한 것이 아니다
첫 번째 과제는 설명을 이해하고 의미에 따라 이미지를 구성하는 것입니다. 이 부분에서는 Elo 상위권 모델인 GPT Image 2, Reve, MAI가 주도적인 역할을 합니다. 다만 러시아 내 접근성을 기준으로 볼 때, 동결된 소스들에 따르면 공식적으로 사용이 제한된 것은 OpenAI/GPT Image 2 및 Gemini/Nano Banana뿐이며, Reve와 MAI는 해당되지 않습니다. 두 번째 과제는 읽을 수 있는 키릴 문자 (Cyrillic)를 출력하면서 문화적 맥락을 잃지 않는 것입니다. 즉, 일반적인 '겨울용 모자'가 아니라 '소비에트 포스터 (Soviet poster)', '러시아 전통 가옥 (Russian izba)', '우샨카 (Ushanka)'와 같은 맥락을 살려야 합니다. Kandinsky 5.0은 이를 위해 별도의 기반을 갖추고 있습니다. 학습 과정에 '러시아 문화 코드 (Russian Cultural Code)'가 포함되어 있는데, 여기에는 수작업으로 작성된 러시아어 설명이 담긴 768,555개의 이미지와 229,504개의 비디오 장면이 포함됩니다. 또한 모델이 처음부터 두 언어로 사전 학습(Pre-training)되었기 때문에, 프롬프트는 외부 번역기가 아닌 단일 인코더 (Encoder)에 의해 처리됩니다 (Kandinsky 5.0, arXiv).
OpenAI는 방식이 다릅니다. Responses API에서 주요 LLM 모델은 '결과 개선을 위해' 사용자 프롬프트를 자동으로 다시 작성하며, 그 결과는 revised_prompt 필드로 반환됩니다 (Image generation guide, OpenAI). 따라서 GPT Image 2의 러시아어 품질은 최소한 부분적으로는 이러한 LLM 재작성 과정을 거칩니다. 공개된 문서에는 러시아어 요청이 번역되는지, 그리고 그것이 생성에 정확히 어떤 영향을 미치는지 명시되어 있지 않습니다. 이를 Kandinsky의 '네이티브' 러시아어 능력과 단일 지표로 비교하는 것은 부적절합니다. 이는 동일한 문제에 대한 서로 다른 공학적 해결책이기 때문입니다.
Nano Banana Pro를 제목에 언급된 Nano Banana 2와 혼동해서는 안 됩니다. 이들은 가격이 다른 Google의 인접 모델들입니다. Nano Banana 2는 1K당 $0.067인 반면, Pro는 1K/2K당 $0.134입니다. 거의 모든 공개적인 고품질 분석과 텍스트 렌더링에 관한 언급은 Pro 모델에 해당하며, 이를 더 저렴한 Nano Banana 2에 직접 적용할 수는 없습니다. AIRA의 CEO인 알료나 크류코바 (Alyona Kryukova)는 과제를 언어가 아닌 이미지 유형에 따라 나눕니다. 지역성, 문화적 맥락, 정확한 키릴 문자 표기는 Kandinsky의 영역으로, 구도 제어, 세부 묘사 및 복잡한 다인물 장면은 Nano Banana Pro의 영역으로 분류합니다 (TenChat, Kryukova). 따라서 러시아어 프롬프트 측면에서 단일 승자를 가리기는 어렵습니다.
편리한 논지를 깨뜨리는 반론
러시아어 프롬프트 이해도에 대한 공개적인 측정치는 존재하지 않습니다. Artificial Analysis는 언어별 구분 없이 (S01-2) 주로 영어 쿼리에 기반한 블라인드 테스트(blind votes)로 순위를 매깁니다. 키릴 문자(Cyrillic)와 문화적 코드(cultural code) 측면에서 우위에 있다는 Sber의 주장은 벤더(vendor) 측의 주장입니다. 기업 발표 자료에는 SBS(side-by-side) 수치가 명시되어 있지 않으며, 기술 보고서의 공개된 부분에서도 비교 가능한 side-by-side 수치를 확인할 수 없었습니다. "러시아 모델이 러시아어를 더 정확하게 이해한다"는 논지는 접근성(access)의 결과물일 수 있습니다. 정상적인 결제 수단을 가진 사용자에게는 블라인드 테스트 결과 GPT Image 2와 Nano Banana 2가 더 나은 프롬프트 준수(prompt following) 능력을 보여줄 것이며, Google이 주장하는 다국어 텍스트 렌더링(multilingual render) 기능은 상위 모델인 Nano Banana Pro에 대한 설명입니다. Nano Banana 2에 대해서는 발표 자료에서 별도의 약속이 없습니다 (Nano Banana Pro, Google).
하지만 접근성은 그 자체로 중요한 축입니다. 러시아는 OpenAI의 공식 지원 국가 목록(Supported countries and territories, OpenAI)에도 포함되어 있지 않으며, 230개 이상의 국가와 70개 이상의 언어를 지원한다고 명시된 Gemini Apps의 지원 국가 목록(Available countries and languages, Google)에도 없습니다. Romania와 Rwanda 사이에 러시아는 없습니다. 실질적인 우회 방법은 루블화로 결제 가능한 러시아어 기반 애그리게이터(aggregator)를 이용하는 것입니다. 이러한 분석 자체도 VPN 사용이 해외 카드 결제 문제에 부딪힌다는 점을 확인시켜 주며, 해당 자료가 특정 서비스의 프로모션 코드를 포함하고 있다는 점에서 이는 상업적 동기가 있는 일화적인 관찰일 뿐 독립적인 평가라고 볼 수 없습니다 (Nano Banana в России, Хабр/ЦНИС).
최상위권 모델의 가격 또한 추상적인 문제가 아닙니다. GPT Image 2 (high)는 1,000장당 211달러인 반면, Reve 2.1은 24달러, MAI-Image-2.5-Flash는 20달러입니다. 불량률(error rate)이 동일하다면, 선두 모델은 정상적인 이미지를 얻기 위한 비용을 한 자릿수(order of magnitude) 차이로 더 비싸게 만듭니다. 또한 비공식 채널을 통해 결과물을 상업적으로 사용할 권리에 대해서는 그 누구도 명시하지 않았습니다.
상업 블로그의 수동 테스트에 따르면, Nano Banana Pro(Nano Banana 2가 아닌 해당 모델을 테스트함)의 러시아어 프롬프트는 "눈에 띄는 품질 저하 없이 작동"하며, 가장 큰 돌파구로 정확한 텍스트 렌더링을 꼽았습니다. 하지만 복잡한 타이포그래피(Typography)와 비표준적인 구도는 테스트된 6개 모델 모두에게 여전히 문제로 남아 있습니다: Nano Banana Pro, FLUX, Midjourney, Seedream, GPT Image, Imagen 4. Kandinsky는 표본에 포함되지 않았으며, 이에 대한 비교 가능한 수동 데이터가 없습니다 (Как сгенерировать картинку, Habr/TsNIS). 방법론이 공개되지 않았으므로 이는 참고용일 뿐입니다.
네 가지 생성기와 다섯 가지 결정 파라미터 — 수치로 보는 결과
실질적인 선택은 다섯 가지 파라미터(Parameter)에 달려 있습니다: 우회 없는 접근성, 일일 제한(Daily limit), 해상도, 워터마크, 그리고 결과물에 대한 권리입니다.
| Kandinsky 5.0 | Shedevrum (무료) | Nano Banana 2 | GPT Image 2 | |
|---|---|---|---|---|
| VPN 및 해외 카드 없이 러시아에서 접근 가능 여부 | 예, open-weight (S12-1) | 예, Yandex의 공식 서비스 (S11-1) | 아니요, Gemini Apps 지원 국가 목록에 러시아가 없음 (S08-1) | 아니요, OpenAI 지원 국가 목록에 러시아가 없음 (S07-1) |
| ... | ||||
| Google의 가격과 Shedevrum의 일일 제한은 버전 날짜와 변경 로그(Changelog)가 없는 벤더 페이지—Gemini API pricing 페이지와 Yandex Direct 지식 베이스의 "Shedevrum: 이미지 생성을 위한 서비스 사용법" 기사—에서 가져왔으므로, 결정하기 전에 이 수치들을 반드시 재확인해야 합니다. |
표를 통해 Elo 점수에는 나타나지 않는 사실을 알 수 있습니다. Shedevrum은 품질의 문제가 아니라 법적으로 상품 카드(product card) 사용이 제한됩니다. 결과물의 사용은 개인적인 비상업적 목적으로만 허용되며, 상업적 이용은 Yandex와의 사전 협의를 통해서만 가능합니다 (Shedevrum 이용 약관, Yandex). MIT 라이선스 하의 Kandinsky 5.0은 표에서 상업적 권리를 별도로 요청할 필요가 없는 유일한 옵션이지만, 무료인 대신 그래픽 카드(GPU) 비용이 따릅니다. Image Lite의 경우 최소 12GB VRAM이 필요하다고 명시되어 있으며, 테스트는 이미지당 약 13초의 지연 시간(latency)을 보이는 80GB H100에서 수행되었습니다. 소비자용 그래픽 카드에서는 이보다 더 느릴 것입니다 (README, Kandinsky Lab).
만약 비상업적 포스트를 위한 일회성 이미지가 목적이라면, 'Shedevrum Pro'가 문제를 빠르게 해결해 줍니다. 4K 해상도, 워터마크 제거, 두 개 대신 여섯 개의 옵션을 제공합니다. 하지만 월 100루블의 비용은 활성화된 Yandex Plus를 전제로 하며, 이 옵션은 2025년 3월 보도자료에 기술되어 있으므로 결제 전 가격과 구성을 확인해야 합니다 (보도자료, Yandex). 구독은 해상도, 워터마크, 옵션 개수를 변경할 뿐 결과물에 대한 권리를 변경하는 것은 아닙니다. 즉, 'Pro를 결제하면 광고에 사용할 수 있다'는 연결 고리는 원천 자료에서 확인되지 않습니다. 상품 카드나 광고 크리에이티브를 제작하려는 경우, 어떤 요금제의 Shedevrum이나 어그리게이터(aggregator)를 통한 미결제 우회 방식은 모두 함정입니다. 전자는 권리 측면에서, 후자는 채널의 지속 가능성 측면에서 위험합니다. 결국 자신의 라이선스를 가진 Kandinsky를 사용하거나, 순위 상위 모델들에 대한 유료 접근 권한을 갖는 방법 중 하나를 선택해야 합니다.
두 번째 방법은 보통 소프트웨어적으로 필요합니다: 이미지 생성이 카드 제작 파이프라인(pipeline)이나 팀 도구에 내장된 경우입니다. 이 경우 결제 채널이 모델과 분리됩니다. provod.ai는 현재 카탈로그에 있는 이미지 모델들에 대해 OpenAI 호환 접근 권한을 제공합니다. OpenAI 프로토콜에 맞춰 작성된 클라이언트는 base URL과 API 키를 교체하는 것만으로 연결할 수 있으며, VPN과 해외 카드라는 복잡한 과정 없이 러시아 카드, SBP(Fast Payment System), 또는 계좌 이체를 통해 루블로 결제할 수 있습니다. 기업 고객에게는 러시아 법인의 계약서, 인보이스, 결제 정보 및 증빙 서류가 제공됩니다. 다만, 이는 이미지의 구체적인 사용에 대한 법적 검토를 대신하지는 않습니다. Kandinsky의 존재가 사라지는 것은 아닙니다: MIT 방식은 여전히 자신의 GPU에서 독립적으로 실행할 수 있으며, 자신의 실행 결과와 유료 API를 비교해야 합니다.
결론은 간단합니다: 결정은 접근성, 결과물에 대한 라이선스, 그리고 특정 작업에 따른 오류 비용의 조합으로 이루어집니다. 포스트, 상품 카드, 또는 기업용 파이프라인에 따라 필요한 세트는 달라질 것입니다.
provod.ai — 공급업체가 아닌 작업에 맞춰 모델을 선택하세요
코드, 복잡한 추론 (reasoning), 검색, 긴 문서 및 미디어 생성은 서로 다른 도구를 필요로 합니다: API, 잔액, 팀의 인프라를 유지하면서 모델을 전환하십시오.
하나의 카탈로그에서 텍스트 및 미디어를 위한 최신 모델을 확인하세요: 텍스트의 경우 OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, xAI의 Grok, DeepSeek, Qwen, GLM, Kimi 및 MiniMax가 있으며, 이미지의 경우 Nano Banana 2 Pro 및 GPT Image가 있습니다. 비디오의 경우 Seedance, Kling, Veo 및 Google Omni의 최신 버전이 제공됩니다. 또한 추론 (reasoning), 검색, 문서, 임베딩 (embeddings), 음악 및 오디오를 위한 모델도 사용할 수 있습니다.
애그리게이터의 숨겨진 추가 비용 없이 품질과 비용을 비교하세요: 가격은 제공업체의 공식 요율과 1:1로 동일하게 적용되므로, 선택은 provod.ai의 불필요한 수수료가 아닌 작업 내용에 따라 결정됩니다.
귀하의 시나리오에 맞는 모델을 선택하세요: 등록 양식 · 모델 가격 · 152-FZ에 따른 데이터 보호 · provod.ai 메인 페이지
출처
출처
- Text to Image Leaderboard — Artificial Analysis Image Arena
- Kandinsky 5.0: линейка open-source моделей — Хабр, 블로그 스베르방크
- Kandinsky 5.0: A Family of Foundation Models — arXiv
- kandinskylab/kandinsky-5 — GitHub 모델 저장소
- Image generation guide (gpt-image-2) — OpenAI 문서
- Supported countries and territories — OpenAI
- Gemini API pricing — Google
- Gemini Apps: available countries and languages — Google
- Nano Banana Pro: анонс — 블로그 구글
- Условия использования сервиса «Шедеврум» — Yandex
- Яндекс запустил новую линейку YandexART и опцию Про в Шедевруме — 보도 자료
- Яндекс Директ: лимиты Шедеврума
- Kandinsky 5.0 и Nano Banana Pro — TenChat, 알료나 크류코바
- Nano Banana в России: как пользоваться без VPN — Хабр, 블로그 CNIS
- Как сгенерировать картинку по тексту нейросетью — Хабр, 블로그 CNIS
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
