API를 통한 오픈 소스 LLM: 내가 더 일찍 알았더라면 좋았을 가이드
요약
오픈 소스 LLM을 직접 호스팅하는 것과 API를 사용하는 것 사이의 비용 효율성을 비교 분석합니다. DeepSeek, Qwen, GLM 등 주요 오픈 소스 모델의 API 단가와 GPU 클러스터 운영 비용을 구체적인 수치로 제시하며 최적의 선택 가이드를 제공합니다.
핵심 포인트
- 오픈 소스 모델의 성능이 폐쇄형 모델을 빠르게 추격 중
- 직접 호스팅 시 발생하는 GPU 클라우드 비용의 위험성 경고
- DeepSeek, Qwen 등 주요 모델별 API vs 호스팅 비용 비교
- 사용 사례에 따른 경제적인 모델 선택 전략 제시
API를 통한 오픈 소스 LLM: 내가 더 일찍 알았더라면 좋았을 가이드
지난달, 나는 클라우드 GPU 제공업체로부터 받은 1,400달러짜리 청구서를 멍하니 바라보고 있었다. 약 3주 동안 오픈 소스 언어 모델 (open-source language model)을 활용해 작은 실험을 진행하고 있었는데, 청구 금액이 벌써 주택 담보 대출 상환액처럼 보이기 시작했다. 그 순간부터 나는 몇 달간의 집착에 빠지게 되었다. 바로 오픈 소스 LLM (Large Language Models)을 직접 운영하는 것과 단순히 API를 호출하는 것 사이의 실제 비용 차이를 파악하는 것이었다.
여러분의 골칫거리를 덜어드리겠다. 이것이 현재 내가 이 문제를 바라보는 방식이며, 내가 "클러스터 배포 (deploy cluster)"를 클릭하기 전에 누군가 나에게 말해줬으면 했던 내용이다.
내가 왜 오픈 소스 모델에 관심을 갖기 시작했는가
오랫동안 나는 모든 것에 대해 OpenAI나 Anthropic에 비용을 지불하는 것에 완전히 만족했다. 그러다 두 가지 현상이 동시에 일어나는 것을 목격했다. 첫째, 오픈 웨이트 모델 (open-weight models)이 빠르게 추격하고 있었다. 즉, 이들과 폐쇄형 프런티어 모델 (closed-source frontier models) 사이의 격차가 매 분기 줄어들고 있었다. 둘째, 나의 월간 토큰 (token) 비용이 계속해서 상승하고 있었다.
나는 궁금해지기 시작했다. 내가 브랜드 값에 비용을 지불하고 있는 것인가, 아니면 실제 성능에 비용을 지불하고 있는 것인가? 결과적으로 내가 구축하고 있던 많은 것들에 대해 오픈 소스 모델들은 충분히 훌륭했다. 그리고 훨씬 더 저렴했다.
그래서 나는 이 문제의 심연으로 뛰어들었다. 내가 발견한 것들을 여러분께 공유하겠다.
알아둘 가치가 있는 오픈 소스 라인업
아무도 말해주지 않는 사실이 하나 있다. 오픈 소스 모델 분야는 약어와 버전 번호로 뒤섞여 엉망이라는 점이다. Qwen이 어떻고, GLM이 어떻고, DeepSeek이 어떻고 하는 식이다. 내가 스스로를 위해 만든 실질적인 치트 시트 (cheat sheet)를 알려주겠다.
합리적인 가격에 순수한 성능을 원한다면, DeepSeek V4 Flash는 Global API를 통해 출력 토큰 100만 개당 0.25달러의 비용이 들며, 이를 GPU에서 직접 운영하려면 한 달에 500달러에서 2,000달러 사이를 지불해야 한다. DeepSeek V3.2로 업그레이드하면 API를 통해 100만 개당 0.38달러가 들며, 자체 호스팅 (self-hosting) 비용은 800달러에서 3,000달러 사이가 된다.
Alibaba의 Qwen 제품군은 일상적인 업무에서 제가 개인적으로 가장 선호하는 모델입니다. Qwen3-32B는 API 사용 시 출력 100만 개당 0.28달러인 반면, 직접 호스팅 (self-hosting)할 경우 월 4001,500달러가 듭니다. Qwen3-8B는 100만 개당 0.01달러로 말도 안 되게 저렴하여 사실상 무료에 가까우며, 직접 호스팅할 경우 월 200800달러가 소요됩니다. 그다음으로 Qwen3.5-27B는 출력 100만 개당 0.19달러이며, 호스팅 비용은 월 300~1,200달러 정도입니다.
더 무거운 작업을 위해서는 ByteDance의 Seed-OSS-36B가 API를 통해 100만 개당 0.20달러로 제공되며, 직접 호스팅 시 월 5002,000달러가 듭니다. GLM-4-32B는 출력 100만 개당 0.56달러(직접 호스팅 시 월 4001,500달러)로 더 비싼 옵션이지만, 그보다 작은 모델인 GLM-4-9B는 다시 100만 개당 0.01달러(직접 호스팅 시 월 200~800달러)로 내려갑니다.
몇 가지 새로운 진입 모델들도 있습니다: Tencent의 Hunyuan-A13B는 100만 개당 0.57달러(직접 호스팅 시 월 3001,000달러)이며, Ling-Flash-2.0은 출력 100만 개당 0.50달러(직접 호스팅 시 월 3001,000달러)입니다. 두 모델 모두 Apache 2.0 라이선스이거나 오픈 웨이트 (open weights) 모델로, 사용 사례에 따라 살펴볼 가치가 있습니다.
숫자가 너무 많다는 것을 알고 있습니다. 조금만 더 따라와 주세요. 계산이 더 명확해질 것입니다.
직접 호스팅 (Self-Hosting)의 실제 비용
여기가 제가 시행착오를 겪은 부분입니다. 저는 "오픈 소스 (open source)"가 "무료"를 의미한다고 생각했습니다. 하지만 그렇지 않습니다. 그것은 "가중치 (weights)는 무료이지만, 이제 전기료, GPU, DevOps 시간, 그리고 무언가 고장 났을 때 새벽 3시에 호출을 받아야 하는 특권을 위해 비용을 지불해야 한다"는 뜻입니다.
GPU 비용이 실제로 어떤 모습인지 보여드리겠습니다.
7B9B 범위의 작은 모델의 경우, 단일 A100 40GB가 필요합니다. 클라우드 대여 비용은 월 400800달러입니다. 하드웨어를 구매하여 감가상각(amortize)한다면 월 200400달러 정도로 잡을 수 있습니다. 13B14B 모델의 경우, 클라우드에서는 A100 80GB 한 대에 6001,200달러, 온프레미스 (on-prem)에서는 300600달러를 고려해야 합니다.
많은 프로덕션 워크로드 (production workloads)를 위한 최적의 지점은 27B32B 범위이며, 여기에는 두 대의 A100 80GB 카드가 필요합니다. 이 경우 클라우드 가격은 월 1,0002,000달러, 온프레미스는 5001,000달러입니다. 70B72B 모델을 실행하고 싶다면 A100 80GB 네 대를 계획하십시오. 클라우드에서는 월 2,0004,000달러, 감가상각 시에는 1,0002,000달러가 듭니다. 그리고 거대한 200B+ 모델의 경우 A100 80GB 여덟 대가 필요하며, 이는 클라우드에서 월 4,0008,000달러, 온프레미스에서 월 2,0004,000달러입니다.
이 가격들은 Lambda Labs, RunPod, Vast.ai와 같은 곳의 예약 인스턴스 (Reserved Instance) 가격입니다. 온디맨드 (On-demand) 방식은 이보다 더 비쌉니다.
아무도 언급하지 않는 숨겨진 비용
이것이 저의 두 번째 실수였습니다. 저는 GPU 예산만 세웠고, 말 그대로 그 외의 모든 것을 잊어버렸습니다.
모두 합산해 보겠습니다. GPU 서버는 규모에 따라 월 $400–$8,000가 소요됩니다. 로드 밸런서 (Load Balancer)와 API 게이트웨이 (API Gateway)에 추가로 $50–$200가 듭니다. 모니터링 (Monitoring) 및 알림 (Alerting) 도구에 $50–$200가 듭니다. DevOps 엔지니어의 시간 — 부분적인 할당이라 할지라도 — 에 $500–$3,000가 소요됩니다. 모델 업데이트 및 유지보수 (Maintenance)에 $100–$500가 듭니다. 그리고 온프레미스 (On-prem)에서 운영한다면, 전기 요금이 추가로 $200–$1,000가 더 붙습니다.
결과적으로, 순수 GPU 대여 비용을 제외한 "숨겨진" 비용은 월 $900에서 $4,900에 달합니다. GPU 항목 자체는 계산에도 넣지 않은 수치입니다. 이 금액들을 합산했을 때 저는 거의 숨이 막힐 뻔했습니다.
수치가 실제로 갈리는 지점
손익분기점(Break-even) 문제에 대해 제가 생각하는 방식은 다음과 같습니다. 결국 핵심은 하루에 얼마나 많은 토큰 (Tokens)을 처리하느냐에 달려 있습니다.
시나리오 A: 하루 100만(1M) 토큰. 만약 당신이 취미로 하거나 작은 프로젝트를 운영 중이라면, 셀프 호스팅 (Self-hosting)의 계산 결과는 가혹합니다. DeepSeek V4 Flash에 대한 API 접근 비용은 30M 토큰 × $0.25/M = 월 $12.50입니다. 가장 작은 GPU 설정으로 셀프 호스팅을 하더라도 최소 $400부터 시작합니다. API가 32배 더 저렴합니다. 이 정도 규모에서는 셀프 호스팅이 타당성을 갖는 우주는 존재하지 않습니다.
시나리오 B: 하루 5,000만(50M) 토큰. 이것이 보통 "성장하는 스타트업"이 위치하는 지점입니다. API를 통하면, V4 Flash 비용은 1.5B 토큰 × $0.25/M = 월 $375입니다. 2× A100 80GB 장비로 셀프 호스팅을 하면 월 $1,000–$2,000가 소요되며, 최적화를 통해 하루 약 5,000만 토큰을 처리할 수 있습니다. 그럼에도 API가 여전히 3~5배 더 저렴합니다.
시나리오 C: 일일 5억(500M) 토큰. 이제 기업 규모(enterprise scale)의 이야기가 시작됩니다. API를 통한 V4 Flash는 15B 토큰 × $0.25/M = $3,750가 소요됩니다. Qwen3-32B는 $4,200가 소요되는데, 이는 토큰당 가격이 V4 Flash보다 높지만 모델이 더 나은 결과를 제공할 수 있어 결과적으로 전체 토큰 사용량을 줄일 수 있다는 점에서 흥미롭습니다. 8× A100 GPU로 셀프 호스팅(Self-hosting)을 할 경우 클라우드에서는 $4,000–$8,000가 들며, 하드웨어를 직접 소유하고 있다면 $2,000–$4,000가 듭니다. 이 규모에서는 진정으로 우열을 가리기 어렵습니다. 유연성을 원한다면 API를, 인프라 팀이 있고 장기적인 비용 통제를 원한다면 셀프 호스팅을 선택하면 됩니다.
핵심 요약: Global API를 통한 API 액세스는 일일 약 5,000만(50M) 토큰을 넘기 전까지는 셀프 호스팅보다 저렴합니다. 그 지점을 넘어서면 손익분기점(break-even zone)에 진입하며, 셀프 호스팅이 비용 경쟁력을 갖게 됩니다. 단, DevOps 팀이 있는 경우에만 해당됩니다.
내가 거의 항상 API를 선택하는 이유
수개월 동안 수치를 계산해 본 결과, 저는 몇 가지 지루한 진실로 계속 돌아오게 됩니다.
설정 시간: 셀프 호스팅은 며칠에서 몇 주가 걸립니다. API 액세스는 5분이면 충분합니다. 직접 시간을 재보았는데, Global API를 사용하여 키를 가져오고 래퍼(wrapper)를 작성하는 것을 포함해 DeepSeek V4 Flash가 요청에 응답하기까지 5분도 걸리지 않았습니다. 반면 동일한 모델을 셀프 호스팅하는 데는 드라이버, CUDA 버전, vLLM 설정 등을 만지느라 긴 주말을 통째로 써야 했습니다.
모델 전환: 셀프 호스팅을 하면 새로운 모델을 시도할 때마다 다시 배포하고 재설정해야 합니다. API를 사용하면 코드 한 줄만 바꾸면 됩니다. 그게 전부입니다.
확장성(Scaling): 셀프 호스팅에서 확장이란 더 많은 GPU를 구매하거나 대여하는 것을 의미합니다. API를 사용하면 확장은 그냥 저절로 이루어집니다. 용량을 추가하기 위해 티켓을 제출해 본 적이 단 한 번도 없습니다.
업데이트: 새로운 모델 버전이 출시되면 셀프 호스팅은 수동 재배포를 의미합니다. API는 자동으로 업데이트를 받습니다.
다중 모델: 셀프 호스팅을 하면 기본적으로 GPU 클러스터당 하나의 모델을 사용할 수 있습니다. Global API를 사용하면 단일 키 하나로 184개의 모델을 사용할 수 있습니다.
가동 시간(Uptime): 셀프 호스팅을 하면 모든 장애(outage)는 여러분의 문제입니다. API를 사용하면 제공업체가 SLA(Service Level Agreement)를 보장합니다.
비용 비교는 실제로 매우 높은 볼륨(high volume)에서만 유의미한 차이가 발생합니다. 낮은 볼륨에서는 유휴(idle) 상태인 GPU조차 비용이 발생하며, 모델을 사용하든 사용하지 않든 그 비용을 지불해야 합니다.
코드가 어떻게 생겼는지 보여드리겠습니다
좋습니다, 여기 제가 더 많은 블로그 포스트에서 실제로 보여주기를 바랐던 부분이 있습니다. Global API를 호출하기 위한 Python 코드를 안내해 드리겠습니다.
먼저, OpenAI의 Python 클라이언트(OpenAI와 호환되는 모든 엔드포인트에서 작동합니다)를 사용하는 기본적인 채팅 완성(chat completion) 예시입니다:
import os
from openai import OpenAI
...
이게 전부입니다. 설정의 전 과정입니다. 베이스 URL(base URL)이 https://global-apis.com/v1이라는 점에 주목하세요. OpenAI SDK와 즉시 교체하여 사용할 수 있는 호환성을 갖추고 있습니다.
이제 출력을 스트리밍(streaming)하고 모델 간의 비용을 비교하는 약간 더 정교한 예시를 보겠습니다:
import os
from openai import OpenAI
...
Qwen3-8B와 GLM-4-9B의 결과는 여러분을 깜짝 놀라게 할 것입니다. 출력 토큰 100만 개(1M)당 0.01달러라는 가격 덕분에, 아주 적은 돈으로 수천 개의 쿼리(query)를 실행할 수 있습니다. 저는 더 큰 모델을 찾기 전까지 수년 동안 이 모델들을 저의 "1차 방어선(first line of defense)" 모델로 사용해 왔습니다.
하이브리드 전략 (The Hybrid Play)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기