부트캠프 졸업생으로서 2026년에 발견한 가장 저렴한 AI API들
요약
부트캠프 졸업생의 시각에서 다양한 AI API의 가격 차이를 분석하고, 비용 효율적인 모델 선택 가이드를 제공합니다. 초저예산 모델부터 플래그십 모델까지의 가격대를 분류하여 개발자가 예산에 맞춰 적절한 모델을 선택할 수 있도록 돕습니다.
핵심 포인트
- Qwen, GLM 등 중국 모델 사용 시 1M 토큰당 $0.01 수준의 초저가 이용 가능
- 작은 모델(8B급)은 복잡한 추론은 부족하나 단순 작업 및 테스트에 최적
- 출력 토큰 가격을 기준으로 초저예산, 저예산 등 티어별 분류 필요
- 프로젝트 목적에 맞는 모델 선택이 개발 비용 절감의 핵심
6주 전만 해도 저는 API 토큰이 무엇인지조차 몰랐습니다. 그러다 부트캠프 캡스톤 프로젝트(capstone project)가 시작되었고, 갑자기 수십 개의 언어 모델(language models) 가격 페이지를 들여다보며 프로토타입(prototype)을 출시하기도 전에 파산하지 않을 모델이 무엇인지 찾아내야 하는 상황에 놓였습니다. 제가 발견한 사실은 너무나 놀라워서 반드시 글로 남겨야만 했습니다.
처음 시작할 때 아무도 말해주지 않는 사실이 있습니다. AI로 무언가를 만드는 것은 공짜가 아닙니다. 여러분의 앱이 프롬프트(prompt)를 보내고 응답(response)을 받을 때마다 비용을 지불하게 됩니다. 그리고 모델 간의 가격 차이는 정말 말도 안 될 정도로 큽니다. 우리는 1페니의 아주 작은 부분만큼 비용이 드는 아주 작은 실험적 모델부터, 출력 토큰(output tokens) 100만 개당 3.50달러를 부과하는 플래그십 추론 모델(flagship reasoning models)까지 경험했습니다. 저의 순진했던 생각으로는 "AI API"라면 가격이 하나일 것이라고 가정했습니다. 틀렸습니다.
제 프로젝트에 적합한 모델을 선택하려고 노력하며 배운 모든 것을 안내해 드리겠습니다. 이 포스트의 가치 절반은 실제로 신뢰할 수 있는 수치를 제공하는 데 있기 때문에, 모든 가격을 제가 발견한 그대로 정확하게 유지하겠습니다.
나를 "잠깐, 뭐라고?"라고 말하게 만든 첫 번째 사실
Global API 가격 페이지를 열고 맨 아래까지 스크롤했을 때 저는 충격을 받았습니다. 출력 토큰 100만 개당 말 그대로 0.01달러인 모델들이 있었습니다. 단 1페니입니다. 할인 프로모션 가격이나 임시방편적인 우회 방법을 말하는 것이 아닙니다. 이것들은 Qwen 및 GLM(Zhipu로도 알려짐)과 같은 주요 중국 연구소에서 만든 실제 프로덕션 준비가 된(production-ready) 모델들입니다. Qwen3-8B 모델과 GLM-4-9B 모델은 모두 입력 토큰 100만 개당 0.01달러, 출력 토큰 100만 개당 정확히 0.01달러입니다.
이런 것이 가능하다는 것을 전혀 몰랐습니다. 저는 진심으로 최저 가격이 50센트 정도일 것이라고 생각했습니다. 알고 보니, 작은 모델을 사용할 의향만 있다면 최저 가격은 사실상 거의 없는 것이나 다름없었습니다.
물론 트레이드오프 (trade-off)는 가공되지 않은 능력 (raw capability)입니다. 이러한 작은 8B급 모델들은 복잡한 작업을 수행할 때 논리적 추론을 제대로 해내지 못할 수도 있습니다. 하지만 사용자 피드백 분류, 간단한 챗봇 실행, 또는 개발 중 빠른 테스트와 같은 용도로는 완벽합니다. 제 멘토는 이들을 "새로운 프리 티어 (free tier)"라고 불렀는데, 솔직히 그렇게 생각하는 것이 아주 좋은 방법이라고 봅니다.
이 모든 정보를 정리하기 시작한 방법
40개 이상의 모델이 있다는 것을 깨달았을 때, 저는 이들을 분류(buckets)하지 않으면 정신을 잃을 것 같았습니다. 저는 커피 한 잔을 들고 출력 가격 (output pricing)을 기준으로 저만의 정신적인 티어 (tier) 시스템을 구축했습니다. 결과는 다음과 같습니다:
- 초저예산 (Ultra-Budget, 출력 1M 토큰당 $0.01 ~ $0.10): 단순한 작업, 테스트, 학습용입니다. Qwen3-8B, GLM-4-9B, GLM-4.5-Air, Qwen3.5-4B, 그리고 Qwen2.5-14B 같은 모델들이 여기에 속합니다. Hunyuan-Lite 또한 출력 가격 $0.10로 이 티어의 최상단에 위치합니다.
- 저예산 (Budget, 출력 1M 토큰당 $0.10 ~ $0.30): 실제 개발 작업을 위한 최적의 지점 (sweet spot)입니다. 제가 대부분의 시간을 보낸 구간이기도 합니다. Step-3.5-Flash ($0.15), Qwen3.5-27B ($0.19), Hunyuan-Standard ($0.20), Hunyuan-Pro ($0.20), Qwen3-14B ($0.24), 그리고 이 분야의 진정한 주인공인 출력 1M 토큰당 $0.25의 DeepSeek V4 Flash가 여기에 있습니다.
- 중급 (Mid-Range, 출력 1M 토큰당 $0.30 ~ $0.80): 실제 프로덕션 (production)에 투입하는 용도입니다. Doubao-Seed-Lite ($0.40), Qwen3-VL-32B ($0.52), Hunyuan-Turbo ($0.57), 그리고 DeepSeek V4 Pro ($0.78)가 여기에 속합니다.
- 프리미엄 (Premium, 출력 1M 토큰당 $0.80 ~ $2.00): Hunyuan-Turbo, GLM-4.6, Doubao-Seed-Lite, DeepSeek V4 Pro, MiniMax M2.5, GLM-5, 그리고 Doubao-Seed-Pro 같은 모델들입니다. 진정으로 고성능이 필요할 때 사용하는 모델들입니다.
- 플래그십 (Flagship, 출력 1M 토큰당 $2.00 ~ $3.50): 거대 지능 (big-brain) 티어입니다. DeepSeek-R1, Kimi K2.5, Kimi K2.6, Qwen3.5-397B가 있습니다. 이들은 추론 모델 (reasoning models), 즉 "말하기 전에 생각하는" 모델들입니다.
참고로, GPT-4o는 출력 토큰(output tokens) 100만 개당 약 $10.00 수준입니다. 저는 그 가격을 보고 마시던 콜드 브루를 뿜을 뻔했습니다. 같은 플랫폼, 같은 연도임에도 저가형 계층(budget tier)보다 10배나 비쌉니다. 이 수치는 마치 무시해 보라는 듯이 눈앞에 버티고 서 있습니다.
나에게 모든 것을 바꿔놓은 모델
DeepSeek V4 Flash에 대해 잠시 찬사를 보내고 싶습니다. 이 모델은 128K 컨텍스트 윈도우(context window)를 제공하며, 출력 토큰 100만 개당 $0.25, 입력 토큰(input tokens) 100만 개당 $0.18의 비용이 듭니다. 제가 이 모델을 캡스톤 프로젝트의 평가 하네스(evaluation harness)에 연결했을 때, 그 품질은 훨씬 더 비싼 모델들과 놀라울 정도로 유사했습니다. GPT-4o가 제공하는 성능의 약 85~90% 수준을 유지하면서, 비용은 말 그대로 40배나 저렴합니다.
제 프로젝트는 사용자가 제출한 지원 티켓(support tickets)에서 구조화된 데이터(structured data)를 추출하는 작업이었습니다. DeepSeek V4 Flash는 이를 훌륭하게 처리했습니다. 저는 뭔가 함정이 있을 거라며 계속 기다렸지만, 함정은 끝내 나타나지 않았습니다. 만약 실제적인 추론(reasoning)이 필요한 무언가를 구축하고 있고, 여러분의 런웨이(runway, 자금 소진 전까지의 기간)를 존중한다면, 여기서부터 시작하십시오.
중간 계층에서 발견한 멋진 것들
128K 컨텍스트의 영웅들: 많은 저가형 모델들이 32K 토큰에서 상한선이 걸려 있는데, 저는 긴 문서 요약(long-document summarization) 기능이 완전히 망가졌을 때 이를 뼈저리게 배웠습니다. 예산 내에서 긴 컨텍스트(long context)가 필요하다면 ByteDance-Seed-OSS ($0.20 출력, 128K 컨텍스트), ERNIE-Speed-128K ($0.20 출력, 128K 컨텍스트 및 $0.00 입력 비용 — 즉, 입력은 말 그대로 무료입니다), Qwen2.5-72B ($0.40 출력, 128K 컨텍스트), 그리고 Hunyuan-TurboS ($0.28 출력, 32K)를 살펴보세요. 특히 ERNIE-Speed-128K는 입력 비용이 0달러라는 점에서 저를 깜짝 놀라게 했습니다. 0달러입니다. 프롬프트에 소설 한 권을 통째로 집어넣어도 출력되는 것에 대해서만 비용을 지불하면 됩니다.
저예산 멀티모달 (Multimodal): 이미지나 오디오를 처리해야 한다면, Qwen3-VL-32B (비전(vision) 출력 $0.52)와 Qwen3-Omni-30B (멀티모달(multimodal) 출력 $0.52)를 확인해 보세요. 두 모델 모두 수행하는 작업에 비해 놀라울 정도로 저렴합니다.
라우팅 트릭 (The routing trick): 저는 출력 비용이 $0.13인 GA-Economy와 $0.20인 GA-Standard라는 것을 우연히 발견했습니다. 이것들은 일반적인 모델이 아니라, 사용자의 쿼리에 대해 가장 적합한 기반 모델을 자동으로 선택해 주는 라우팅 레이어 (routing layers)입니다. 솔직히 아직 프로덕션 (production) 환경에서 사용해 보지는 않았지만, 비용 최적화 (cost optimization) 측면에서 개념이 매우 스마트합니다.
나의 첫 번째 작동하는 코드 예시
자, 이제 실제 API 호출이 어떻게 생겼는지 보여드리고 싶습니다. 저는 어떤 호환 가능한 엔드포인트 (endpoint)와도 작동하는 OpenAI Python 클라이언트를 사용하고 있으며, 이를 Global API의 베이스 URL (base URL)로 지정하고 있습니다. 이 부분은 제가 "문서를 읽는 단계"에서 "실제로 무언가를 만드는 단계"로 넘어간 프로젝트의 과정이었으며, 정말 짜릿한 기분이었습니다.
import os
from openai import OpenAI
...
제가 고생하며 배워야 했던 몇 가지 사항이 있습니다. 첫째, base_url 파라미터 (parameter)는 동일한 클라이언트 코드를 통해 어떤 OpenAI 호환 제공업체도 사용할 수 있게 해주는 마법의 스위치입니다. 둘째, API 키를 위해 반드시 환경 변수 (environment variables)를 설정해야 합니다. 코드에 직접 입력(hardcode)하지 마세요. 저는 거의 졸 뻔했던 부트캠프 강의에서 이 점을 배웠고, 지금은 매일 감사하고 있습니다. 셋째, 일관된 출력을 원한다면 추출 스타일 (extraction-style) 작업에는 temperature=0.2가 아주 좋습니다.
내가 쓴 비용 vs 친구가 쓴 비용
실제 수치를 알려드리겠습니다. 모든 테스트, 디버깅 (debugging), 그리고 세 곳의 서로 다른 고용주에게 보여준 실제 데모를 포함한 저의 부트캠프 캡스톤 (capstone) 프로젝트 전체 비용은 API 수수료로 4달러 미만이었습니다. 제 동기 중 한 명은 동일한 종류의 작업에 GPT-4o를 사용했고, 결과물을 내놓기 전에 80달러를 써버렸습니다. 같은 프로젝트임에도 결과는 극명하게 달랐습니다.
그렇다고 GPT-4o가 나쁘다는 뜻은 아닙니다. 분명히 훌륭한 모델입니다. 하지만 그저 배우고 프로젝트를 완성하려는 개발자에게는 완전히 불필요한 지출입니다. 하루에 1달러씩 쓰는 습관은, 특히 끊임없이 반복 작업 (iterating)을 할 때는 빠르게 쌓이게 됩니다.
약간 더 발전된 예시
기본적인 호출 (calls)에 익숙해진 후, 저는 스트리밍 (streaming)을 실험하기 시작했습니다. 이는 제 챗봇 데모의 게임 체인저 (game-changer)였는데, 전체 응답을 기다리는 대신 텍스트가 단어 단위로 하나씩 나타나기 때문입니다. 포트폴리오 환경에서는 훨씬 더 인상적입니다.
import os
from openai import OpenAI
...
여기서 저는 Qwen3-32B를 사용하고 있는데, 이는 32K 컨텍스트 (context)에서 출력(output) $0.28, 입력(input) $0.18의 비용이 듭니다. 극단적인 저예산보다는 품질이 더 중요한 채팅 스타일의 상호작용에서 제 주력 모델이 되어 왔습니다. 타자기 효과를 내기 위해서는 end=""와 flush=True가 매우 중요합니다. 이것들이 없으면 출력이 버퍼링 (buffering)되어 덩어리째 나타나는데, 이는 매우 매끄럽지 못하게(janky) 보입니다.
예상치 못했던 기묘한 발견들
진정으로 해커가 된 것 같은 기분을 느끼게 해준 몇 가지 무작위적인 발견들입니다:
- GLM-4.5-Air: 출력 $0.01, 입력 $0.07. 약간 특이한 가격 구조이지만, 전반적으로 여전히 매우 저렴합니다.
- Doubao-Seed-1.6: 출력 $0.80, 입력은 단 $0.05. 만약 거대한 프롬프트 (prompts)를 넣고 짧은 완성 (completions)을 얻는 작업(예: 거대한 문서를 한 문장으로 요약하도록 모델에 요청하는 경우)을 한다면, 이것은 금광과 같습니다.
- Hunyuan-Pro 및 Hunyuan-Standard: 둘 다 출력 $0.20, 입력 $0.09로 정확히 일치합니다. 동일한 가격입니다! 제가 잘못 읽은 것이 아닌지 두 번이나 확인했습니다.
- GLM-4-9B: 더 큰 형제 모델들과 동일한 32K 컨텍스트를 가지면서 가격은 $0.01입니다. 왜 더 많은 비용을 지불하겠습니까? (답은 품질 때문이겠지만, 그래도 말이죠.)
초보자로서의 솔직한 티어별 추천
이제 막 시작해서 학습용 모델이 필요하다면, 6주간의 빌딩 (building) 경험을 바탕으로 한 저의 실제 의견은 다음과 같습니다:
이제 막 요령을 배우는 중인가요? Qwen3-8B 또는 GLM-4-9B를 선택하세요. 1M 토큰당 $0.01라는 무료 티어 수준의 가격은 말 그대로 따라올 자가 없으며, 교육용 프로젝트에는 완벽하게 충분합니다.
실제 프로토타입 (prototype)을 만드는 중인가요? 언제나 DeepSeek V4 Flash입니다. $0.25/M의 출력 가격과 강력한 성능의 조합은 타의 추종을 불허합니다.
더 긴 컨텍스트 윈도우 (context window)가 필요한가요? ByteDance-Seed-OSS 또는 Qwen2.5-72B를 사용하세요. 둘 다 큰 비용 부담 없이 128K를 지원합니다.
시각(Vision) 기능이나 멀티모달(Multimodal) 기능이 필요한가요? 이미지 관련 작업에는 Qwen3-VL-32B를, 오디오 기능까지 필요하다면 Qwen3-Omni-30B를 사용하세요.
비용 결제를 다른 사람이 부담하는 기업용 프로덕션(Enterprise production) 환경인가요? 그렇다면 MiniMax M2.5, GLM-5, 또는 Doubao-Seed-Pro를 고려해 볼 수 있습니다. 이 모델들은 $0.80에서 $2.00 사이의 가격대를 형성하고 있습니다. 혹은 Kimi K2.6이나 Qwen과 같은 플래그십(Flagship) 모델을 $2~$3.50 가격대에 사용할 수도 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기