부트캠프 졸업생의 오픈 소스 AI API 탐구: 내가 배운 것들
요약
부트캠프 졸업생이 오픈 소스 AI 모델의 비용 효율성과 API 활용법을 탐구한 경험담입니다. DeepSeek, Qwen 등 오픈 소스 모델의 저렴한 API 가격과 직접 호스팅(Self-hosting) 시 발생하는 GPU 인프라 비용을 비교 분석합니다.
핵심 포인트
- DeepSeek, Qwen 등 오픈 소스 모델의 API 비용이 매우 저렴함
- 상용 모델(GPT-4o 등) 대비 높은 가성비의 대안 모델 존재
- 직접 호스팅 시 클라우드 GPU 대여 비용이 상당할 수 있음
- 모델 크기와 필요 GPU 사양에 따른 비용 계산의 중요성
사실은 이렇습니다: 부트캠프 졸업생의 오픈 소스 AI API 탐구: 내가 배운 것들
저는 약 6개월 전에 코딩 부트캠프를 졸업했습니다. 솔직히 말해서, 저는 AI 지형을 이해하고 있다고 생각했습니다. GPT-4o, Claude, 그리고 누군가 좀 더 화려한 것을 원한다면 Gemini 정도 — 그것이 기본적으로 제 머릿속의 모델이었습니다. 그러다 사이드 프로젝트를 만들기 시작했는데, 기술 트위터(tech Twitter) 스레드에서 사람들이 "오픈 소스 모델 (open-source models)"을 언급하는 것을 계속 듣게 되었고, 그들이 무엇에 대해 말하고 있는지 전혀 알지 못했습니다. 저는 주말 내내 이 토끼굴(rabbit hole)에 빠져 시간을 보냈고, 제가 발견한 것은 진심으로 저를 놀라게 했습니다. 그래서 대화에서 소외감을 느끼는 다른 누군가에게 도움이 될 수 있도록 제 이야기를 들려드리려 합니다.
"오픈 소스 AI"가 실재한다는 것을 깨달은 날
저는 친구(시니어 엔지니어)에게 제 프로젝트를 위해 GPT-4o를 호출하는 비용이 얼마나 비쌀지에 대해 불평하고 있었습니다. 저는 대략적인 계산(napkin math)을 하고 있었습니다. 예를 들어, 한 달에 10,000개의 요약을 생성한다면, 그것은 상당한 비용이 될 것이라는 식이었죠. 그는 그냥 무심하게 말했습니다. "Qwen3나 DeepSeek를 써보는 건 어때? 기본적으로 품질은 비슷해."
비슷한 품질. 훨씬 적은 비용으로 말이죠. 저는 충격을 받았습니다. 제 머릿속에는 즉시 "잠깐, 이것들이 유명한 모델들만큼 좋아?"라는 생각이 들었고, 그는 기본적으로 "직접 써봐"라고 말했습니다.
그래서 저는 직접 해보았습니다. 그리고 그것이 제가 이 글을 쓰게 된 계기가 되었습니다.
내 생각을 바꿔놓은 가격표
제가 무엇을 사용해야 할지 혼란스러울 때마다 계속 다시 찾아보는 모델 목록을 보여드리겠습니다. 이것들은 API를 통해 호출할 수 있는 오픈 소스 모델들이며, 각각의 출력 토큰(output token) 가격은 다음과 같습니다:
| 모델 (Model) | 라이선스 (License) | API 가격 (출력) |
|---|---|---|
| DeepSeek V4 Flash | Open weights | $0.25/M |
| ... |
가격이 그렇게 낮아질 수 있다는 것을 전혀 몰랐습니다. Qwen3-8B와 GLM-4-9B가 출력 토큰 100만 개당 0.01달러라고요? 제 부트캠프 강사님은 가격이 항상 가장 큰 장벽이라고 말씀하셨습니다. 분명히 이제는 그렇지 않은 것 같습니다.
"그냥 직접 호스팅(Self-Host)하면 안 돼?" — 나를 또 다른 구렁텅이로 몰아넣은 질문
API 가격에 대한 불안감이 진정되자, 다음으로 논리적인 질문이 머릿속을 스쳤습니다. '잠깐, 이것들이 오픈 소스(Open Source)라면, 그냥... 내 컴퓨터에서 직접 돌리면 안 되나? 아니면 어디서 GPU를 빌려오든가?'
네, 가능합니다. 하지만 바로 이 지점에서 제 머릿속 계산기는 순식간에 엄청난 비용을 산출하기 시작했습니다.
저는 Lambda Labs, RunPod, Vast.ai(인기 있는 클라우드 GPU 대여 플랫폼들입니다)의 서버 대여 비용을 살펴보기 시작했습니다. 모델 크기에 따라 한 달에 대략적으로 지불해야 하는 금액은 다음과 같습니다:
| 모델 크기 | 필요 GPU | 클라우드 대여 | 온프레미스 (On-Prem, 분할 상환 기준) |
|---|---|---|---|
| 7-9B | 1× A100 40GB | $400-800 | $200-400 |
| ... |
A100은 괴물 같은 GPU입니다. 새 제품 가격이 10,000달러 이상 하죠. 그런데 그런 걸 8대나 빌린다고요? 그럼 한 달에 최소 4,000달러에서 8,000달러입니다. A100 단 한 대를 빌리는 데만 한 달에 400~800달러가 든다는 사실에 충격을 받았습니다. 모델 하나를 구동하기 위해 자동차 할부금을 내는 격이었으니까요.
아무도 경고해주지 않은 비용들
여기서부터 저는 정말 식은땀이 나기 시작했습니다. GPU 가격에만 너무 집중한 나머지 다른 모든 것들을 잊고 있었던 것입니다. (그 엔지니어 친구의 도움을 받아) 좀 더 현실적인 예산을 짜보니 다음과 같은 결과가 나왔습니다:
| 비용 항목 | 월간 예상치 |
|---|---|
| GPU 서버 (유휴 상태 또는 부하 상태) | $400-8,000 |
| ... |
잠깐, 서버를 관리할 사람에게 돈을 지불해야 한다고요? 그리고 A100 GPU 8대를 돌리기 위한 전기 요금이 별도의 항목으로 잡힌다고요? 부트캠프 시절의 저는 이런 것까지 예산에 넣지 않았습니다. 직접 AI를 운영한다는 것이 기본적으로 소규모 데이터 센터(Data Center)를 운영하는 것과 다름없다는 사실을 전혀 몰랐습니다.
계산이 실제로 맞아떨어지는 시점 (혹은 그렇지 않은 시점)
언제쯤 셀프 호스팅(Self-hosting)이 경제적 타당성을 갖게 될지 알아보기 위해 세 가지 가상 시나리오를 만들어 보았습니다. 그 결과가 저를 놀라게 했으니, 하나씩 설명해 드리겠습니다.
시나리오 A: 나의 사이드 프로젝트 (일일 100만 토큰 사용)
이것이 현재 제 상황입니다. 하루에 100만 토큰, 사실상 거의 없는 수준이죠. 수치를 계산해 보았습니다:
- API를 통해 DeepSeek V4 Flash 사용 시: 30M 토큰 × $0.25/M = 월 $12.50
- 소형 GPU 셀프 호스팅 시: 월 $400-800 (그리고 GPU는 대부분 유휴 상태로 방치됨)
그게 전부입니다. API를 사용하는 것이 말 그대로 저에게 32배 더 저렴합니다. GPU는 대부분의 시간 동안 사용되지도 않는데 저는 여전히 비용을 지불하고 있었습니다. 잠시라도 셀프 호스팅 (Self-hosting)을 고려했다는 사실이 바보같이 느껴졌습니다.
시나리오 B: 내 사이드 프로젝트가 스타트업이 될 때 (일일 5,000만 토큰)
재미 삼아, 하루 5,000만 토큰까지 규모를 확장한다고 가정해 보았습니다:
- API (DeepSeek V4 Flash): 1.5B 토큰 × $0.25/M = 월 $375
- 셀프 호스팅 (2× A100 80GB): 월 $1,000-2,000 (이것은 당신이 엄청나게 최적화를 했다고 가정했을 때의 비용입니다)
따라서 이 규모에서도 API가 여전히 3~5배 더 저렴합니다. 충격적이었습니다. 어딘가에
- 설정 시간 (Setup time): 셀프 호스팅 (Self-hosting)은 서버를 프로비저닝하고, 드라이버를 설치하고, 가중치 (weights)를 다운로드하고, 추론 엔진 (inference engines, vLLM, TGI 등 무엇이든)을 설정한 다음 이를 외부에 노출하는 것을 의미합니다. 며칠에서 몇 주가 걸립니다. API를 사용한다면요? 저는 5분 만에 첫 번째 요청을 보냈습니다. 농담이 아닙니다.
- 모델 전환 (Model switching): 셀프 호스팅을 하면 모델을 전환할 때 보통 전체 스택을 다시 배포해야 합니다. API를 사용하면 말 그대로 코드 한 줄만 바꾸면 됩니다. 실험을 할 때 이는 매우 강력한 기능입니다.
- 업데이트 (Updates): 모델 제공자가 가중치를 개선하면, API를 통해 단순히 새 버전을 호출하기만 하면 됩니다. 셀프 호스팅을 하면 수 기가바이트의 데이터를 다시 다운로드하며 아무것도 망가지지 않기를 기도해야 합니다.
- 다중 모델 (Multiple models): Global API는 하나의 API 키 뒤에 약 184개의 모델을 보유하고 있다고 읽었습니다. 단 하나로 말이죠. 셀프 호스팅은 그렇게 작동하지 않습니다. 셀프 호스팅은 기본적으로 GPU 클러스터당 하나의 모델을 사용합니다.
- 가동 시간 (Uptime): 제 API 호출은 그냥 작동합니다. 셀프 호스팅을 하면 모든 중단(outage)은 제 책임이며, 지적할 수 있는 SLA (Service Level Agreement)도 없습니다.
내가 실제로 작성한 코드 (그리고 작동했다)
부트캠프 졸업생들이 코드를 보는 것을 좋아한다는 것을 알기에, Global API를 통해 DeepSeek V4 Flash를 테스트하는 데 사용한 실제 코드 스니펫을 공유합니다. 이것은 순수 Python입니다:
import requests
api_key = "your-global-api-key"
...
이 코드를 실행했고 1초도 안 되어 일관성 있는 답변을 받았습니다. 정말 놀라웠습니다. 인증(authentication) 및 속도 제한(rate limits)과 싸우느라 주말을 다 보낼 줄 알았는데, 응답이 그냥 나타났습니다.
그 다음 더 저렴한 테스트를 위해 Qwen3-8B를 시도했습니다 (100만 토큰당 $0.01이므로):
import os
from openai import OpenAI
...
네, OpenAI 클라이언트 라이브러리입니다! 베이스 URL (base URL)을 OpenAI 대신 Global API로 지정하기만 하면, 제가 이미 GPT-4o에서 사용하던 것과 동일한 코드 패턴으로 오픈 소스 모델을 호출할 수 있습니다. 제공업체를 교체하는 것이 이렇게 쉬운 줄은 전혀 몰랐습니다.
셀프 호스팅이 의미 있는 경우 (진심으로)
셀프 호스팅이 항상 틀렸다고 주장하는 사람이 되고 싶지는 않습니다. 셀프 호스팅을 해야 하는 실제적인 이유들이 있습니다:
- 엄청나게 높은 수준의 데이터 프라이버시 (Data privacy at crazy-high stakes): 만약 당신이 병원이나 방위 산업 계약업체라면, 당신의 데이터는 말 그대로 법적으로 당신의 인프라를 절대 벗어나서는 안 될 수도 있습니다. 이 경우 API는 선택 사항이 아닙니다.
- 이미 하루 5억 토큰 (500M tokens/day) 이상을 사용 중이며, DevOps 팀이 있거나 (혹은 당신이 직접 DevOps 팀이거나) 하는 경우.
- 헤비하게 파인튜닝 (Fine-tuning) 중이며, 추론 엔진 (Inference engine)에 대한 세밀한 제어가 필요한 경우.
- 말 그대로 서버 운영을 즐기는 경우, 이 경우라면 제발 제 친구가 되어주세요.
그 외의 모든 사람, 특히 포트폴리오 프로젝트를 만들거나 작은 스타트업을 운영하는 부트캠프 졸업생들에게는 API 경로가 그냥... 훨씬 더 단순합니다. 제가 쓴 글 중 가장 부트캠프 졸업생스러운 말인 것 같지만, 사실입니다.
내가 시도할 뻔했던 하이브리드 전략 (The Hybrid Strategy I Almost Tried)
나는 사람들이 두 가지를 모두 사용하는 하이브리드 접근 방식에 대해 읽다가 '너드 스나이핑 (Nerd-sniped)'을 당했습니다. 기본적으로 다음과 같습니다:
- 개발 (Development) 및 스테이징 (Staging) → API (빠르게 움직이고 싶기 때문)
- 정상 부하 상태의 프로덕션 (Production) → API (신뢰성이 중요하기 때문)
- 트래픽 급증 시의 프로덕션 (Production) → 다시 API, 자동 확장 (Auto-scale)이 가능하기 때문
- 충분히 규모가 큰 경우에만 → 지루한 베이스라인 트래픽은 셀프 호스팅할 수도 있음
실제로 중소규모의 거의 모든 사람들은 그냥 모든 것에 API를 사용합니다. 하이브리드 방식은 기업용(Enterprise)에 더 가깝지만, 저는 멋진 아이디어라고 생각했습니다.
한 달 후 나의 솔직한 견해
나는 어떤 숨겨진 비법을 찾을 수 있을 거라 생각하며 이 일에 뛰어들었습니다. 그
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기