
LTX 2.3 및 Kandinsky 5.0 Video: 2026년 7월, 당신의 그래픽 카드에서 실제로 구동 가능한 것은 무엇인가
요약
LTX 2.3 및 Kandinsky 5.0 Video 모델의 로컬 구동을 위한 하드웨어 요구 사양을 분석합니다. 마케팅 정보와 실제 개발자 요구 사항 간의 차이를 경고하며, VRAM 용량에 따른 모델 실행 가능 여부를 다룹니다.
핵심 포인트
- Kandinsky 5.0 Video Pro는 현재 H100(96GB) 또는 A100(80GB)급 데이터 센터 GPU가 필요함
- LTX-2.3 bf16 모델은 약 52GB의 VRAM을 요구하여 RTX 4090(24GB)에서 구동 불가
- 4비트 양자화 적용 시 LTX-2.3은 약 18GB VRAM으로 구동 가능
- 양자화 및 증류(distilled) 버전을 사용해야 소비자용 GPU에서 실질적 구동 가능
한 벤더는 RTX 4090이면 충분하다고 말합니다. 모델 개발자는 H100이 필요하다고 말합니다. 이 가격 차이는 수십만 루블에 달합니다.
이것은 가설적인 사례가 아닙니다. GPU 호스팅 가이드인 Serverflow는 Kandinsky 5.0 Video Pro를 VRAM 40~80+ GB 범위에서 "최적화"를 통해 RTX 4090에서 실행할 수 있다고 주장합니다. 하지만 Sber의 모델 개발자는 Habr의 릴리스에 대한 코멘트에서 다음과 같이 직접적으로 쓰고 있습니다: 현재 Pro 버전은 96GB의 H100 또는 80GB의 A100을 요구하며, 24GB로 낮추는 것은 향후 VAE 최적화 이후의 계획일 뿐입니다 (VArkhipkin의 댓글). 만약 당신이 벤더의 가이드를 믿고 Pro 버전을 위해 4090을 구매한다면, 영상 대신 OOM(Out of Memory)을 마주하게 될 것입니다.
따라서 로컬 실행에 대한 논의는 마케팅 카드에 근거해서가 아니라, 1차 출처를 통해 확인된 사실과 이미 실행을 시도해 본 사람들이 말하는 내용에 기반하여 이루어져야 합니다.
2026년 7월의 현실적인 선택
구독 없이 사용할 수 있는 두 가지 오픈 소스 제품군 중에서, 현재 소비자용 하드웨어에서 작동 가능한 것은 경량화된 버전인 LTX-2.3 dev/distilled 및 Kandinsky 5.0 Video Lite뿐입니다. Kandinsky의 Video Pro는 개발자의 발표에 따르면 아직 데이터 센터용 그래픽 카드에서만 구동되며, 비용을 낮추려는 계획은 확인된 날짜 없이 여전히 계획 단계에 머물러 있습니다.
Hugging Face의 LTX-2.3 공식 모델 카드(model card)는 220억 개의 파라미터(parameters), Python ≥3.12, CUDA >12.7 및 bf16 정밀도(precision)를 명시하고 있지만, 최소 VRAM 용량을 직접적으로 언급하지는 않습니다 (model card Lightricks/LTX-2.3). 구체적인 수치는 벤더 가이드에서 제공합니다. bf16 버전은 약 52GB가 필요하며, 4비트 양자화(4-bit quantization)를 적용하면 약 18GB가 필요합니다 (intelion.cloud, 가격 책정 및 구성). LTX 자체 블로그는 이를 해상도 권장 사항을 통해 다르게 표현합니다. 24GB 이상의 VRAM을 갖춘 GPU는 20 스텝(steps)으로 4초 동안 720p24를 구동할 수 있고, 8~16GB GPU는 540p24만 가능하며, NVFP4/FP8 양자화를 사용하면 VRAM 사용량을 60%까지 줄이고 생성 속도를 최대 3배까지 높일 수 있습니다 (ltx.io, Low VRAM Guide).
하드웨어 구매를 위한 표
| 모델 / 빌드 | 최소 VRAM | 권장 VRAM | 라이선스 | 상업적 임계값 | GPU |
|---|---|---|---|---|---|
| LTX-2.3 dev (bf16) | ~52 GB | 80 GB (A100/H100) | LTX-2 Community License | 연 매출 $1,000만 | A100/H100 |
| ... |
24GB와 관련해서는 행을 혼동하지 않는 것이 중요합니다. Low VRAM Guide의 "24GB 이상 → 720p24, 4초, 20 스텝" 권장 사항은 전체 bf16 모델이 아닌, 양자화(quantized) 및 증류(distilled)된 빌드에 해당합니다. 약 52GB를 요구하는 bf16 기반의 전체 dev 모델은 어떤 운 좋은 상황에서도 24GB 그래픽 카드에 들어가지 않습니다. 이 모델을 위해서는 자체 보유 중이거나 대여한 A100/H100 80GB가 필요합니다.
'Pro' 행은 오타가 아니라 출처 간의 충돌을 기록한 것입니다. 호스팅 제공업체인 Serverflow는 모델의 접근성을 보여주고 싶어 하는 반면 (serverflow.ru), 개발자의 코멘트는 요구 사항을 미화하려는 상업적 이해관계 없이 기술적인 사실을 직접적으로 진술한 것입니다. 예산을 계획할 때는 후자를 신뢰하는 것이 좋습니다.
라이선스는 VRAM만큼이나 중요합니다
LTX-2.3은 LTX-2 커뮤니티 라이선스 계약 (LTX-2 Community License Agreement)에 따라 배포됩니다. 2차 리뷰에서는 이를 Apache 2.0이라고 부르기도 하지만, Hugging Face의 LICENSE 파일을 직접 확인해 보면 이는 사실이 아닙니다. 상업적 이용은 회사의 연간 매출이 1,000만 달러($10M) 미만인 경우에만 무료이며, 이 임계값을 초과하면 유료 라이선스가 필요합니다 (LICENSE, Commercial Entities). 벤더 측은 임계값을 넘더라도 이미 수행된 생성 작업에 대해 소급 적용되는 비용은 발생하지 않는다고 별도로 설명합니다 (ltx.io, Licensing Explained). 즉, 지난 몇 달간의 작업에 대해 소급 청구서를 받을 위험 없이 사업을 확장할 수 있습니다.
이런 면에서 Kandinsky 5.0은 더 단순합니다. 코드와 가중치 (weights)가 MIT 라이선스 하에 있어, 매출 임계값이나 상업적 이용에 대한 제한이 없습니다 (README kandinskylab/kandinsky-5). 두 모델 제품군 모두에서 유일하게 해결되지 않은 영역은 가중치가 아닌 생성된 영상 자체에 대한 저작권 문제입니다. 이 문제는 어떤 라이선스에도 별도로 명시되어 있지 않으므로, 상업적 프로젝트의 경우 별도의 법률 자문을 통해 이 부분을 해결해야 합니다.
왜 Lite 모델은 소비자용 그래픽 카드에서 작동하는가
Kandinsky Lite의 속도는 우연이 아닙니다. 이 아키텍처는 NABLA 희소 주의 (sparse attention) 메커니즘을 사용하는데, 개발자들의 프리프린트 (preprint) 데이터에 따르면 90%의 희소도 (sparsity)를 적용했을 때 학습 및 추론 (inference) 시간을 2.7배 단축할 수 있다고 합니다 (arXiv 2511.14993v3, NABLA mechanism). 이는 저자들의 자체 벤치마크 결과이며, 타사 하드웨어에서의 독립적인 재현 결과는 아직 발표되지 않았으므로 이 수치는 보증이 아닌 기대치의 상한선으로 받아들여야 합니다.
모델 저장소(repository)의 H100 기반 지연 시간 (latency) 측정값은 대략적인 규모를 가늠할 수 있는 기준을 제공합니다. Video Lite (SFT)로 5초 길이의 클립을 생성하는 데 139초, Video Pro (SD)는 560초, Video Pro (HD)는 1241초가 소요됩니다 (GitHub kandinskylab/kandinsky-5, Latency). 저자들은 소비자용 그래픽 카드에서의 구체적인 측정값은 공개하지 않고 있습니다. 따라서 이 수치들을 RTX 3090에 적용할 때는 단순히 눈대중으로 하는 것이 아니라, 몇 배의 여유를 두고 외삽(extrapolate)해야 합니다.
일치하지 않는 두 목소리
Andrey Peshkov는 Habr의 독립적인 기사에서 다음과 같은 사실을 기록했습니다. Kandinsky 5.0 Pro는 2025년 12월 LMArena Text-to-Video Arena 종합 순위에서 14위를 차지했으며, 이는 20위를 기록한 Wan 2.2 A14B를 제치고 오픈 소스 (open-source) 모델 중 최고의 성적을 거둔 것입니다 (habr.com/ru/amp/publications/979126). 이 글은 하드웨어 요구 사항에 대한 비판 없이 순위에 대한 사실만을 전달하는 리포트이며, 이 순위를 집에서 어떤 장비로 재현할 수 있는지에 대해서는 다루지 않습니다.
반면, Habr에 올라온 해당 기업의 기사 댓글창에서는 다른 이야기가 전개되고 있습니다. 사용자 GhoSt24601은 24GB의 VRAM 요구 사항이 일반 사용자에게 과도하다고 직접적으로 언급하며, 해당 그래픽 카드의 가격을 고려할 때 모델의 실용성에 의문을 제기했습니다. 또 다른 댓글 작성자인 Shannon은 경쟁 모델을 지목하며 다음과 같이 말했습니다: "WAN2.2 can run on 24GB with quantization/optimization techniques" — 즉, Kandinsky 특유의 복잡한 최적화 과정을 거치지 않고도 유사한 결과를 얻을 수 있다는 것입니다 (комментарии к статье Сбербанка на Habr).
가장 강력한 반론과 그에 대한 답변
정당한 반론입니다. 주장된 10~14GB의 최소 사양은 가중치를 시스템 RAM으로 오프로딩 (offloading)하고 공격적인 양자화 (quantization)를 적용했을 때 달성되는 수치이며, 이는 시간이라는 대가를 치러야 합니다. 즉, 생성 속도가 느려지며 때로는 매우 심하게 느려집니다. 동일한 댓글창의 사용자 BazilioMike는 Kandinsky의 결과물을 동급의 다른 생성기들과 비교했을 때 "뭉개진 (blurred)" 상태라고 묘사했는데, 이는 Kandinsky 4에서도 나타났던 문제를 반복하는 것입니다 (BazilioMike의 댓글). 이는 한 개인의 주관적인 인상이지만, 동일한 메모리 용량에서 Wan 2.2가 더 우수하다는 Shannon의 주장과 그 맥락을 같이합니다.
데이터에 기반한 답변이 여기서 완벽하지는 않지만, 몇 가지 근거는 있습니다. 첫째, LMArena 순위 (E09)와 MaxVideoAI의 독립적인 LTX 버전 비교에 따르면, LTX-2.3 Pro는 LTX-2.0 Pro 대비 11개 품질 기준 중 10개에서 앞서며, 제어력과 시각적 품질 측면에서 더 나은 지표를 보여줍니다 (maxvideoai.com, LTX 2.0 vs 2.3 Pro). 이는 모델이 단순히 VRAM 최적화만 이루어진 것이 아니라 실질적인 발전을 이루었음을 시사합니다. 둘째, MaxVideoAI의 독립적 비교 방법론이 완전히 공개되지 않았으므로 결론의 재현성에는 한계가 있습니다. 따라서 이를 확정된 사실이라기보다는 하나의 신호로 받아들여야 합니다. 실무자를 위한 결론을 내리자면, 오프로딩에 대한 반론은 Kandinsky Pro와 LTX의 가장 가혹한 양자화 설정에는 타당합니다. 하지만 LTX-2.3 dev/distilled 및 Kandinsky Lite를 "쾌적한" 구성(극단적인 압축 없는 24GB)으로 사용할 경우 정상적으로 작동합니다. 문제가 되는 경계 시나리오는 이를 10~12GB의 하한선까지 압축하려고 시도할 때 발생합니다.
그래픽 카드를 구매할 것인가, 대여할 것인가
만약 생성이 일회성이거나 프로젝트 단위라면, 대여가 거의 항상 진입 비용보다 저렴합니다. Intelion Cloud는 A100 80GB를 시간당 179루블부터 제공하며, 이는 양자화 (Quantization) 없이 bf16 형식의 LTX-2.3 (~52GB)를 구동하기에 충분합니다 (intelion.cloud). 만약 생성이 정기적이고 매주 이루어진다면, 경제성은 24GB 그래픽 카드를 구매하여 가중치를 RAM으로 옮기지 않고도 VRAM 예산 내에서 작동하는 LTX의 distilled/fp8 빌드 또는 Kandinsky Lite를 사용하는 방향으로 이동합니다.
생성 품질이 본인에게 맞는지 확인하기 위해 GPU 대여에 돈을 쓰기 전에, 인프라 비용 없이 먼저 결과를 살펴보는 것이 합리적입니다: provod.ai는 플랫폼에서 사용 가능한 비디오 모델들을 하나의 호환 가능한 API와 웹 인터페이스를 통해 제공하므로, H100 대여 시간을 결제하기 전에 결과물에 무엇을 기대할 수 있는지 평가할 수 있습니다. 이것이 로컬 실행을 대체한다는 의미는 아닙니다. 가중치 (Weights), 오프라인 작업, 그리고 파이프라인 (Pipeline)에 대한 제어권은 여전히 귀하의 그래픽 카드에 남아 있습니다. 하지만 "이 작업을 위해 정말로 24GB 그래픽 카드가 필요한가"라는 질문은 구매 전에 해결하는 것이 더 저렴합니다.
이 수치들은 최소 분기에 한 번은 재확인해야 합니다: LTX는 LTX-2 출시 단 두 달 만에 2.3 버전을 출시했으며, Kandinsky 개발자는 Pro 버전의 VRAM 요구 사항 감소를 공개적으로 발표했습니다. 이 두 가지 흐름은 이 산업에서 예상하는 것보다 더 빨리 표를 변화시킬 수 있습니다.
provod.ai — 아이디어와 텍스트에서 이미지, 비디오, 오디오까지
수십 개의 서비스 사이를 전환할 필요 없이 콘텐츠 프로세스를 구축하세요: 시나리오, 비주얼, 영상, 음악 및 오디오를 단일 대시보드, API 및 팀 밸런스로 사용합니다.
하나의 카탈로그에서 텍스트 및 미디어용 최신 모델을 확인하세요: OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, xAI의 Grok, DeepSeek, Qwen, GLM, Kimi 및 MiniMax; 이미지용으로는 Nano Banana 2 Pro 및 GPT Image; 비디오용으로는 Seedance, Kling, Veo 및 Google Omni의 최신 버전이 제공됩니다. 또한 추론 (Reasoning), 검색, 문서, 임베딩 (Embeddings), 음악 및 오디오를 위한 모델도 사용할 수 있습니다.
모든 형식은 공급업체의 기본 가격과 1:1로 동일하게 청구됩니다: provod.ai는 계산을 통합하지만 자체적인 추가 마진을 붙이지 않습니다.
provod.ai에서 미디어 제작을 구축하세요: 등록 양식 · 모델 가격 · 152-FZ에 따른 데이터 보호 · provod.ai 메인
출처
- LTX-2 LICENSE 파일, Commercial Entities 섹션
- Hugging Face의 Lightricks/LTX-2.3 모델 카드
- GitHub의 kandinskylab/kandinsky-5 리포지토리
- arXiv의 Kandinsky 5.0 프리프린트 (Preprint)
- LTX 블로그: 라이선스 조건 설명
- Intelion Cloud: LTX-2를 위한 GPU 대여
- Serverflow: Kandinsky 5.0 로컬 실행 가이드
- Habr: LMArena에서의 Kandinsky 5.0 Pro 입지에 관한 기사
- Habr: Kandinsky 5.0에 관한 Sberbank 기사 댓글
- MaxVideoAI: LTX 2.0 Pro와 LTX 2.3 Pro 비교
- LTX 블로그: 낮은 VRAM에서의 실행 가이드
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
