DeepSeek, Qwen, Kimi, 그리고 GLM과 함께한 30일간의 기록
요약
인디 해커가 30일 동안 DeepSeek, Qwen, Kimi, GLM 등 중국계 LLM을 실제 프로덕션 환경에서 테스트한 경험담입니다. 기존 GPT-4o 대비 압도적인 비용 절감 효과와 모델별 성능, 특히 DeepSeek의 가성비와 코드 생성 능력을 분석합니다.
핵심 포인트
- 중국계 LLM(DeepSeek 등)은 서구권 모델 대비 매우 저렴한 비용 제공
- DeepSeek V4 Flash는 초당 60토큰의 빠른 속도와 높은 가성비 보유
- DeepSeek Coder 모델은 리팩토링 및 코드 생성 작업에서 탁월한 성능 발휘
- Global APIs를 활용하면 코드 수정 없이 여러 모델을 쉽게 교체 가능
자, 상황을 말씀드릴게요. 저는 두 개의 SaaS 프로젝트를 운영하는 인디 해커(indie hacker)인데, 제 LLM(Large Language Model) 비용이 감당할 수 없는 수준까지 치솟고 있었습니다. 정말이지 보기가 고통스러울 정도였죠. 저는 기본적으로 거의 모든 작업에 GPT-4o를 사용하고 있었고, 아무 생각 없이 돈을 태우고 있었습니다.
그러다 우연히 중국 AI 업계에 발을 들였는데, 솔직히 말해서? 저는 그동안 완전히 모르고 있었습니다. 정말 심하게 말이죠. DeepSeek, Qwen, Kimi, 그리고 GLM이라는 이 네 가문은 최정상급 수준에서 경쟁하고 있으며, 대부분의 비용이 제가 지불하던 금액에 비해 말 그대로 몇 푼 안 되는 수준이었습니다.
그래서 저는 상식적인 사람이라면 누구나 할 법한 일을 했습니다. 30일 동안 실제 프로덕션 워크로드(production workloads)에서 이 모델들을 돌아가며 사용해 보았습니다. 블로그 포스트 작성, 코드 생성(code generation), 고객 지원 업무, 추론 작업(reasoning tasks) 등 모든 것을 다 해봤습니다. 제가 배운 모든 것을 공유하겠습니다.
설정 (테스트하며 파산하지 않는 방법)
저는 모든 것을 global-apis.com/v1에 있는 Global APIs 통합 엔드포인트(unified endpoint)를 통해 라우팅했습니다. 만약 아직 이것을 확인해보지 않으셨다면... 솔직히 말씀드려, 이건 게임 체인저(game changer)입니다. API 키 하나로 네 가지 제공업체를 모두 사용할 수 있고, 코드를 다시 작성할 필요 없이 모델을 교체할 수 있습니다. 나중에 코드 스니펫(snippet)을 보여드릴게요.
제 테스트 방법론은 간단했습니다:
- 네 가지 모델 모두에 동일한 프롬프트(prompts) 실행
- 실제 응답 품질 추적 (주관적이지만, 나름의 기준이 있습니다 ㅎㅎ)
- 모든 작업의 시간 측정
- 토큰 사용량 및 비용 추적
- 영어와 중국어 작업을 혼합 (제 두 번째 제품은 두 시장을 모두 타겟팅합니다)
솔직한 분석을 들려드리겠습니다.
DeepSeek: 계속해서 다시 찾게 되는 모델
그냥 솔직하게 말할게요. 출력 토큰 100만 개당 0.25달러인 DeepSeek V4 Flash는 좀 말도 안 되는 수준입니다. 그러니까... 거의 공짜나 다름없죠. 일주일 치 콘텐츠 생성을 이 모델로 돌렸는데, 총비용이 라지 피자 한 판 값도 안 나왔습니다.
제가 테스트한 모델 라인업은 다음과 같습니다:
- V4 Flash ($0.25/M) - 나의 데일리 드라이버 (daily driver)
- V3.2 ($0.38/M) - 그들의 최신 아키텍처 (architecture)
- V4 Pro ($0.78/M) - 프로덕션급 (production-grade) 출력이 필요할 때
- R1 (그들의 추론 모델 (reasoner), $2.50/M) - 수학 및 논리 관련 작업
- Coder ($0.25/M) - 코드 특화 작업
좋았던 점
속도. V4 Flash는 초당 약 60 토큰 (tokens per second)에 도달합니다. $0.25짜리 모델이라는 점을 고려하면 솔직히 말도 안 되는 수준입니다. 비용이 10배 더 비싼 일부 서구권 모델들보다 더 빠릿하게 느껴졌습니다.
코드 생성 (Code generation). 가장 까다로운 LeetCode 스타일의 문제들을 던져보았는데, 완전히 압도했습니다. 진심으로 감명받았습니다. 특히 리팩토링 (refactoring) 작업을 많이 한다면 Coder 변체 (variant)를 꼭 시도해 볼 가치가 있습니다.
영어 품질. 솔직히 OpenAI나 Anthropic의 어떤 모델과 비교해도 대등합니다. 블라인드 테스트를 한다면 아무도 차이를 느끼지 못할 것입니다.
**가성비 (Price-to-performance ratio)**는 진심으로 타의 추종을 불허합니다. 더 빨리 갈아타지 않은 게 바보처럼 느껴질 정도입니다.
아쉬웠던 점
비전 (vision) 기능이 제한적입니다. 이미지 이해 (image understanding)가 필요하다면 다른 모델을 찾아보세요. 저는 이미지 관련 작업은 Qwen이나 GLM으로 라우팅 (route)해야 했습니다.
중국어 성능은 좋지만 최고 수준 (best-in-class)은 아닙니다. 중국어 특화 벤치마크 (benchmarks)에서는 GLM과 Kimi가 더 앞섭니다.
모델 크기 선택지가 적습니다. Qwen은 대략 47개의 서로 다른 모델을 보유하고 있습니다 (약간의 과장이지만 무슨 뜻인지 이해하실 겁니다). DeepSeek는 좀 더 타이트하게 유지합니다.
제가 콘텐츠 파이프라인 (pipeline)을 DeepSeek V4 Flash로 전환한 실제 예시는 다음과 같습니다:
from openai import OpenAI
client = OpenAI(
...
정말 이게 끝입니다. 동일한 OpenAI 클라이언트 (client)를 사용합니다. 모델 이름만 바꾸면 됩니다. 끝입니다. 마이그레이션 (migrate)하는 데 5분 정도밖에 걸리지 않았습니다.
Qwen: 맥가이버 칼 (진심입니다)
Qwen은 정말 놀랍습니다. Alibaba가 기본적으로 온갖 것을 다 쏟아부었기 때문입니다. 그들은 모든 것에 대한 모델을 가지고 있습니다. 그리고 솔직히 말하면? 처음에는 약간 압도당할 정도입니다.
제가 테스트한 내용은 다음과 같습니다:
- Qwen3-8B ($0.01/M) - 초저가, 경량 모델
- Qwen3-32B ($0.28/M) - 일반적인 작업을 위한 나의 주력 모델 (workhorse)
- Qwen3-Coder-30B ($0.35/M) - 코드 생성 (code generation)
- Qwen3-VL-32B ($0.52/M) - 이미지 이해 (image understanding)
- Qwen3-Omni-30B ($0.52/M) - 멀티모달 (multimodal) (오디오, 비디오, 이미지)
- Qwen3.5-397B ($2.34/M) - 기업용 추론 (enterprise reasoning)을 위한 대형 모델
가격대는 100만 토큰당 $0.01에서 $3.20 사이입니다. 즉... 어떤 예산이든, 어떤 사용 사례(use case)든, 여기에 적합한 무언가가 있다는 뜻입니다.
잘 작동했던 점 (What worked)
다양성. 솔직히 이 점은 아무리 강조해도 지나치지 않습니다. 이미지를 처리해야 할 때는 Qwen3-VL을 사용했습니다. 오디오 전사 (audio transcription)가 필요할 때는 Qwen3-Omni를 사용했습니다. 저렴한 배치 처리 (batch processing)가 필요할 때는 1센트짜리 Qwen3-8B를 사용했습니다. 정말 말도 안 될 정도입니다.
비전 모델 (vision models)이 탄탄합니다. Qwen3-VL-32B는 OCR 및 이미지 설명을 제가 기대했던 것보다 훨씬 더 잘 처리했습니다. 이를 문서 처리 워크플로우 (document processing workflow)에 통합했는데, 그냥... 제대로 작동했습니다.
기업의 지원. Alibaba의 인프라 덕분에 이 서비스는 다운되지 않습니다. 가동 시간 (uptime)은 결점 없이 완벽했습니다.
활발한 개발. 그들은 계속해서 새로운 버전을 출시합니다. Qwen3.5, Qwen3.6, 그리고 몇 달마다 새로운 변형 모델들이 나옵니다.
짜증 났던 점 (What annoyed me)
네이밍 (naming). 네, 이건 진짜 불만입니다. 예를 들어... Qwen3-32B 대 Qwen3-Coder-30B 대 Qwen3.5-397B 대 Qwen3-VL-32B. 어떤 모델이 무엇을 하는지 기억하기가 어렵습니다. 저는 말 그대로 스프레드시트를 만들어 두었습니다.
중간 수준의 영어 품질. 좋습니다. DeepSeek 수준은 아니지만, 나쁘지도 않습니다. 그냥... 괜찮은 정도입니다.
일부 모델은 가격이 과하게 느껴집니다. DeepSeek V4 Pro가 $0.78이고 대부분의 작업에서 분명히 더 나은 성능을 보이는데, Qwen3.6-35B가 $1/M인 것은 비쌉니다.
제가 일반적인 코딩 작업을 위해 Qwen3-32B를 사용하는 방식은 다음과 같습니다:
response = client.chat.completions.create(
model="Qwen/Qwen3-32B",
messages=[{"role": "user", "content": "Write a Python function to merge two sorted lists"}]
...
네, 동일한 클라이언트(client)입니다. 동일한 global-apis.com 엔드포인트(endpoint)입니다. 모델 문자열만 바꾸면 됩니다. 이것이 제가 이 설정을 좋아하는 이유입니다.
Kimi: 똑똑한 모델 (하지만 프리미엄 가격대)
Moonshot AI의 Kimi는... 흥미롭습니다. 이번 정리된 목록 중에서 모든 모델이 프리미엄 가격대인 유일한 모델입니다. 제가 찾은 가장 저렴한 모델은 출력 토큰 100만 개당 약 $3.00였으며, 플래그십(flagship) 모델인 K2.5는 $3.00/M 수준입니다. 가격 범위는 최대 $3.50까지 올라갑니다.
그렇다면 왜 DeepSeek보다 10배나 더 비싼 비용을 지불해야 할까요? 그 이유는 REASONING (추론) 측면에서 Kimi가 진정으로 이 그룹 중 최고이기 때문입니다. Kimi는 추론 벤치마크 (reasoning benchmarks)에서 1위를 차지합니다. 어떤 경우에는 차이가 거의 나지 않을 정도입니다.
나의 경험
저는 사용자 입력에서 "X라면 Y를 수행하되 Z인 경우는 제외하고, 오직 W일 때만"과 같은 복잡하게 중첩된 로직 (nested logic)을 파싱 (parse)해야 하는 기능을 구축하고 있었습니다. DeepSeek는 괜찮게 처리했습니다. Qwen은 잘 처리했습니다. Kimi는 압도적이었습니다 (CRUSHED it). 응답이 더 깔끔했고, 예외 케이스 (edge cases)를 잡아냈으며, 내용을 지어내지 않았습니다.
수학, 논리 퍼즐, 다단계 추론 (multi-step reasoning), 복잡한 계획 (complex planning) 등을 위해서는 Kimi가 정답입니다.
단점 (가격 제외)
속도는 네 가지 모델 중 가장 느립니다. 그 자체로 느린 것은 아니지만, V4 Flash와 비교하면 눈에 띄게 지연 (laggy)이 느껴집니다.
비전 (vision) 또는 멀티모달 (multimodal) 지원이 없습니다. 텍스트 전용입니다.
모든 모델이 비쌉니다. "저가형 (budget)" 옵션이 없습니다. 당신은 추론 능력 (reasoning capability)에 비용을 지불하는 것입니다.
저는 Kimi를 아껴서 사용했습니다. 예를 들어... 진정으로 최상위 수준의 추론이 필요한 10%의 작업에만 사용했습니다. 그 외의 모든 것에는 다른 모델들이 더 비용 효율적이었습니다.
GLM: 중국어의 챔피언 (그리고 그 이상)
Zhipu AI의 GLM 제품군은 이번 실험 전체에서 저에게 가장 큰 놀라움을 주었습니다. 저는 단순히 "중국어 관련 작업에 괜찮겠지"라고 예상하고 시작했지만, 결과적으로 모든 면에서 진심으로 감명받았습니다.
테스트한 모델:
- GLM-4-9B: $0.01/M - 저가형 (budget) 옵션
- GLM-5: $1.92/M - 플래그십 (flagship)
- 전체 가격 범위: $0.01 ~ $1.92/M
나를 놀라게 한 점
중국어 품질이 타의 추종을 불허합니다. Kimi와 함께 최상위권을 형성하고 있지만, GLM이 더 자연스럽게 느껴집니다. 덜 "번역된" 느낌입니다. 제 중국어 사용 베타 테스터들도 눈에 띄게 이 모델을 선호했습니다.
**GLM-4.6V 비전 모델 (vision model)**은 실제로 정말 뛰어납니다. Qwen3-VL과 경쟁할 만하며, 솔직히 문서 이해 (document understanding) 측면에서는 약간 더 나을 수도 있습니다.
**영어 품질 (english quality)**은 탄탄합니다. DeepSeek 수준까지는 아니지만, 같은 티어에 속합니다.
$1.92/M의 GLM-5는 체급을 훨씬 뛰어넘는 성능을 보여줍니다. 제공되는 품질을 고려하면, $3.00인 Kimi와 비교해도 경쟁력 있는 가격입니다.
잘 작동하지 않았던 부분
코드 생성 (code generation)은 네 가지 모델 중 가장 약합니다. 나쁜 수준은 아니지만, 코드를 배포 (shipping code)해야 한다면 DeepSeek나 Qwen Coder 변형 모델들이 더 나은 선택입니다.
컨텍스트 윈도우 (context window)는 128K로 (여기에 언급된 다른 모델들과 동일함), 차별화 요소는 아닙니다.
대규모 비교 (나의 솔직한 견해)
30일이 지난 후, 특정 작업별로 제가 매긴 순위는 다음과 같습니다:
코딩 및 일반 영어 콘텐츠용: DeepSeek V4 Flash. 타협의 여지가 없습니다. 이 정도 품질에 $0.25/M는 말도 안 되게 저렴합니다.
비전 및 멀티모달 (multimodal)용: Qwen3-VL 또는 GLM-4.6V. 솔직히 동전 던지기를 해도 될 정도입니다. 둘 다 훌륭합니다.
순수 추론 (pure reasoning)용: Kimi K2.5. 비용을 더 지불하더라도 최고의 성능을 얻으세요.
중국어용: GLM-5. Kimi와 동률이지만 가격이 더 좋습니다.
예산 기반 실험용: $0.01/M의 Qwen3-8B. 푼돈으로 수천 개의 프롬프트를 실행할 수 있습니다.
그 사이의 모든 용도: $0.28/M의 Qwen3-32B. 진정한 워크호스 (workhorse)입니다.
비용의 현실
이해를 돕기 위해 설명하겠습니다. 이 실험 전 저의 LLM 청구액은 월 약 $400였습니다. 핵심 워크로드를 DeepSeek와 Qwen으로 전환한 후에는요? 월 $47입니다. 품질과 처리량 (throughput)은 동일하지만, 단지... 더 스마트한 라우팅 (routing)을 할 뿐입니다.
오타가 아닙니다. 제 실제 운영 환경 (production usage)에서 나온 실제 수치입니다.
이 모든 것을 가능하게 만든 코드
중요한 점은, 제가 어떤 복잡한 추상화 계층 (abstraction layer)을 작성하지 않았다는 것입니다. OpenAI 클라이언트 (openai client)와 global-apis.com 엔드포인트 (endpoint) 덕분에 기존 코드를 단 한 줄의 변경만으로 작동시킬 수 있었습니다. 제 라우팅 계층 (routing layer)의 실제 모습은 다음과 같습니다:
from openai import OpenAI
client = OpenAI(
...
그게 전부입니다. 하나의 함수. 여섯 개의 모델. 제가 필요한 것에 따라 교체합니다. 설정하는 데 20분밖에 걸리지 않았습니다.
현재 나의 실제 운영 스택 (Production Stack)
30일 후에 제가 실제로 배포한 구성은 다음과 같습니다:
- 콘텐츠 생성 (Content generation) → DeepSeek V4 Flash ($0.25/M)
- 고객 지원 챗봇 (Customer support chatbot) → Qwen3-32B ($0.28/M)
- 사용자 업로드 이미지 처리 (Image processing in user uploads) → Qwen3-VL-32B ($0.52/M)
- 분석 대시보드의 복잡한 추론 (Complex reasoning in analytics dashboard) → Kimi K2.5 ($3.00/M, 가끔 사용)
- 대량 텍스트 분류 (Bulk text classification) → Qwen3-8B ($0.01/M)
- 중국 시장 제품 카피 (Chinese market product copy) → GLM-5 ($1.92/M)
혼합 모델 사용 (mixed model usage)을 통해 청구 금액을 88% 절감했습니다. 과장이 아니라 정말로 88%입니다.
아무도 말해주지 않는 것들 (Things Nobody Tells You)
이 모델들을 실제 운영 환경(production)에서 실행하며 얻은 몇 가지 솔직한 관찰 결과입니다:
지연 시간 (latency)은 생각보다 중요합니다. V4 Flash의 초당 60 토큰(tokens/sec)과 Kimi의 느린 출력 속도는 실제 사용자 경험(UX)에서 큰 차이를 만들었습니다. 사용자들은 이를 알아챕니다.
어떤 모델은 다른 모델보다 환각 (hallucinate) 현상이 더 심합니다. Kimi는 추론 (reasoning)에 집중한다는 점을 고려하면 당연하게도 환각이 가장 적습니다. Qwen3-8B는 환각이 더 심합니다 (모델이 작으니 당연한 결과입니다).
속도 제한 (rate limits)은 매우 다양합니다. DeepSeek와 Qwen은 관대한 제한을 제공합니다. 저에게는 Kimi가 가장 제한적이었습니다.
소형 모델들을 과소평가하지 마세요. 1센트 가격의 Qwen3-8B는 분류 (classification), 추출 (extraction), 간단한 질의응답 (Q&A)에 진정으로 유용합니다. 모든 작업에 70B 모델이 필요한 것은 아닙니다.
128K의 컨텍스트 윈도우 (context window)는 거의 모든 실제 작업에 충분합니다. 인디 해커 (indie hacker) 프로젝트를 위해 실제로 백만 토큰의 컨텍스트가 필요한 사람은 아무도 없습니다.
전환해야 할까요? (Should You Switch?)
솔직히 말하자면? 무엇을 하고 있느냐에 달려 있습니다.
만약 모든 작업에 GPT-4o나 Claude Sonnet을 사용하고 있고 청구 금액이 계속 올라가고 있다면... 네, 적어도 이 모델들을 테스트해 봐야 합니다. 일반적인 용도로는 DeepSeek V4 Flash부터 시작하세요. 말 그대로 잃을 것이 없습니다.
만약 매우 구체적인 요구 사항(시각 (vision), 추론 (reasoning), 중국어)이 있다면, 대부분의 서구권 옵션을 능가하면서 비용은 더 저렴한 중국 모델이 있습니다.
만약 엄격한 컴플라이언스 (compliance) 요구 사항이 있는 기업이라면, 현재 사용 중인 것을 유지하세요. 이곳은 인디 해커의 영역입니다.
최종 결론 (Final Verdict)
DeepSeek V4 Flash를 최고의 전반적인 가치(overall value)를 가진 모델로 꼽겠습니다. 제가 가장 많이 사용하는 모델입니다. 가성비 (price-to-performance)가 진정으로 압도적이며, 어떤 가격대에서도 이보다 더 나은 데일리 드라이버 (daily driver)를 찾지 못했습니다.
Qwen은 저에게 "가장 다재다능한 (most versatile)" 상을 받았습니다. 만약 단 하나의 모델 제품군 (family)만 선택해야 한다면, 저는 Qwen을 선택할 것입니다. 왜냐하면 모델의 범위가 말 그대로 모든 사용 사례 (use case)를 아우르기 때문입니다.
Kimi는 전문가 (specialist)입니다. 모든 용도로 사용하지는 않겠지만, 추론 (reasoning)이 필요할 때만큼은 그 어떤 것도 비교 대상이 되지 않습니다.
GLM은 다크호스 (dark horse)입니다. 큰 기대를 하지 않고 시작했으나 진심으로 깊은 인상을 받았습니다. 특히 중국어 작업과 그들의 비전 모델 (vision model) 측면에서 그렇습니다.
제 환경에서는 네 가지 모델 모두 global-apis.com/v1을 통해 실행하고 있습니다. 솔직히 말해서, 이 통합 엔드포인트 (unified endpoint) 덕분에 이 모든 실험이 가능했습니다. 통합 코드 (integration code)를 다시 작성할 필요 없이 모델을 교체할 수 있다는 것은 엄청난 (MASSIVE) 이점입니다. 직접 이 설정을 시도해보고 싶다면 global-apis.com을 확인해보세요. 강요하는 것은 아니지만... 그냥 제가 사용하고 있고, 잘 작동하기 때문에 말씀드리는 것입니다.
이것이 저의 30일간의 보고서입니다. 특정 모델에 대해 궁금한 점이 있거나 제가 특정 항목을 테스트해 보길 원하신다면 댓글을 남겨주세요. 기꺼이 더 많은 비교 테스트를 진행하겠습니다.
이제 실례하겠습니다, 이번 달 제 LLM 청구서가 50달러 미만이라는 사실을 즐기러 가야겠네요. 개발하기 정말 좋은 시대입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기