
DeepSeek 앱은 무료지만 API는 토큰을 계산합니다 — 한 번의 요청으로 비용을 확인하는 방법
요약
DeepSeek 앱의 무료 서비스와 달리 API는 토큰 사용량에 따라 비용이 발생하므로 주의가 필요합니다. 개발자는 통합 전 실제 프롬프트를 사용한 테스트를 통해 캐시 상태와 토큰 수를 포함한 정확한 비용 구조를 파악해야 합니다.
핵심 포인트
- DeepSeek 앱의 무료 정책은 API 비용과 무관함
- API 비용은 캐시 히트, 캐시 미스, 출력 토큰에 따라 다르게 적용됨
- 단일 프롬프트를 활용한 카나리 테스트로 비용 구조 검증 권장
- 모델 식별자와 공식 요율 페이지를 기준으로 정확한 비용 계산 필요
Google Play의 DeepSeek 앱 설명에는 어시스턴트가 무료라고 명시되어 있지만, DeepSeek의 공식 API 문서는 토큰 사용량에 따라 비용을 계산합니다. 통합(Integration) 전에 반드시 확인해야 할 경계선은 바로 이것입니다: 사용자용 애플리케이션에서 DeepSeek가 무료라고 해서 API까지 무료라는 의미는 아닙니다. 앱에서는 어시스턴트를 체험해 볼 수 있지만, API를 사용할 때는 어떤 토큰과 어떤 캐시(Cache) 상태로 인해 비용이 발생하는지 미리 파악해야 합니다.
이는 문구에 대한 까다로운 지적이 아닙니다. 팀이 익숙한 무료 채팅 방식으로 결정을 내린 후, API에 긴 지침(Instruction), 대화 기록, 그리고 상세한 답변을 전달할 수 있기 때문입니다. 이 경우 비용은 인터페이스에 대한 인상이 아니라 구체적인 요청(Request)에 의해 결정됩니다.
"무료"는 서로 다른 제품에 적용됩니다
Google Play의 기록은 7월 9일에 업데이트되었습니다. 채팅을 사용해보고 싶은 사람에게는 유용한 정보입니다. Google Play의 DeepSeek 앱은 무료로 설명되어 있습니다. 하지만 API를 위한 DeepSeek Models & Pricing 공식 문서는 다른 계산 모델을 설명합니다. 사용량은 토큰 수에 요율을 곱한 값이며, 캐시 히트(Cache hit), 캐시 미스(Cache miss), 그리고 출력(Output)에 대해 각각 별도의 요율이 적용됩니다.
API에서는 세 가지 별도의 부분이 중요합니다:
| 요청 구성 요소 | 확인 사항 | 비용이 변하는 이유 |
|---|---|---|
| 캐시 히트 입력 (Input with cache hit) | 입력 토큰(Input tokens) 수 및 캐시 히트(Cache hit) 상태 | 캐시 히트 시 별도의 요율이 적용됨 |
| ... |
따라서 출시 전 질문은 "모델이 전반적으로 저렴한가"가 아니라, "우리의 컨텍스트(Context)와 예상 응답 길이를 기준으로 우리 요청의 비용은 얼마인가"가 되어야 합니다. 7월 21일 Hacker News에서는 DeepSeek의 가격이 75% 인하되었다는 자료가 논의되었습니다. 이는 주의를 기울여야 할 신호이지, 새로운 요금제나 확인해야 할 모델 식별자(Identifier)를 의미하는 것이 아닙니다. 계산을 위해서는 모델 이름과 확인 날짜 기준의 API 공식 가격 페이지에 명시된 정확한 요율이 필요합니다.
눈대중으로 하는 불확실한 평가 대신 단 한 번의 요청으로
통합 전에 작은 카나리(Canary) 테스트를 수행하세요. 이것이 미래의 월간 비용을 증명해주지는 않겠지만, 나중에 확장해야 할 메커니즘을 보여줄 것입니다.
고정된 비공개 정보가 없는 하나의 프롬프트를 선택하세요. 예: "통합 전 토큰 확인의 유용성에 대해 중립적인 문장 두 개를 작성하세요." 실행 간에 이 프롬프트를 변경하지 마세요.
이 텍스트만으로는 카나리(canary) 테스트가 완료되었다고 할 수 없습니다. API의 실제 응답 없이는 모델명, 토큰 수, 캐시 상태(cache state) 또는 비용을 정직하게 명시할 수 없기 때문입니다. 재현 가능한 검증은 프롬프트와 응답 기록이 모두 보존된 실제 요청을 한 번 수행한 후에야 가능해집니다. 그 후 다음과 같이 하나의 계산 기록을 작성하세요:
{
"model": "<실제_모델_식별자>",
"price_page_date": "YYYY-MM-DD",
...
수행된 요청의 기록이 추측이 아닌 실제 값으로 각 필드를 채울 수 있는지 확인하세요. 요율(rates)은 모델 이름과 함께 해당 날짜의 공식 요금 페이지에서 다시 작성해야 합니다. 만약 인터페이스나 응답을 통해 모델, 캐시 상태, 필요한 토큰 값 및 적용된 요율 날짜를 확인할 수 없다면, 그것 자체가 검증 결과입니다. 즉, 단 한 번의 요청으로는 비용을 재현 가능하게 계산할 수 없다는 뜻입니다.
공식에 하나의 평균 입력(input) 가격을 대입하지 마세요. 또한 출력 토큰(output tokens)을 누락하지 마세요. 제품이 모델에게 상세한 설명, 재작성 또는 긴 결과 생성을 요구한다면 출력 토큰은 비용을 증가시킵니다.

초기 논리가 무너지는 지점
요율이 낮아졌다면 즉시 워크로드를 이전해도 좋다고 말하는 것이 합리적으로 보일 수 있습니다. 이는 작업이 짧고, 컨텍스트(context)가 작으며, 응답이 몇 줄로 제한되는 경우 특히 강력한 논리입니다. 이 경우 단 한 번의 요청 비용은 실제로 매우 저렴할 수 있습니다.
반전은 추상적인 위험이 아니라 첫 번째 영수증에서 시작됩니다. 영수증에는 단 하나의 "요청 가격"이 아니라, 별도의 cache hit (캐시 히트), cache miss (캐시 미스), 그리고 output (출력) 비용이 표시될 수 있습니다. 고정된 프롬프트가 짧은 답변을 제공했다고 해서, 긴 대화 기록이나 상세한 생성 시나리오의 비용이 보장되는 것은 아닙니다. 공식적인 계산 규칙은 이미 이러한 카테고리를 서로 다른 요율로 구분하고 있습니다. 즉, 캐시 미스는 입력 카테고리를 변경하며, "상세히 답변하라"는 요구는 출력을 증가시킵니다. 할인은 관찰 시점의 요율을 낮춰줄 뿐, 비용 구조 자체를 취소하지는 않습니다.
따라서 단 한 번의 canary (카나리) 테스트를 예산에 대한 약속으로 바꿔서는 안 됩니다. 그 역할은 더 겸손하고 유용합니다. 바로 당신의 제품에서 어떤 변수들이 비용을 눈에 띄게 만들 수 있는지 식별하는 것입니다.
통합 전 진단
자동화된 처리가 필요하고 실제 제한된 시나리오에서 토큰을 측정할 준비가 되었다면 API를 사용하십시오. Google Play에 있는 DeepSeek 앱이 무료라고 설명되어 있다고 해서 이를 무료 API라고 부르지는 마십시오.
부하를 확장하기 전에 다음 조건 중 하나라도 해당된다면 멈추고 솔루션을 재검토하십시오:
- 핵심 요청에 대해 모델, 입력 토큰 (input tokens), 출력 토큰 (output tokens) 또는 캐시 상태 (cache state)가 보이지 않는 경우
- 계산에 확인 날짜가 없는 과거 가격을 사용하는 경우
- 단 하나의 테스트 답변을 모든 사용자에 대한 예측치로 간주하려는 경우
- 제품이 컨텍스트 (context) 길이 또는 답변 길이를 제한하지 않은 경우
- 테스트에 민감한 데이터가 포함된 경우
canary 테스트 이후의 단계는 더 이상 추측이 아니라, 명확하게 기록된 가정을 가진 세 가지 시나리오입니다: 짧은 요청, 전형적인 요청, 그리고 cache miss가 발생하는 긴 요청입니다. 각 시나리오에 자신의 토큰 수와 현재 요율을 대입해 보십시오. 실행 전, 컨텍스트 제한, 답변 제한 또는 모델 재평가가 필요한 임계값을 미리 설정하십시오. 컨텍스트 제한은 입력 토큰의 양을 제어하며, cache miss 상태는 별도로 측정하고 확인해야 합니다. 이렇게 해야 거짓된 정확성이 아닌, 범위와 의사결정 규칙이 생겨납니다.
동일한 제한된 워크로드 (workload)를 단일 API 경로에서 비교해야 할 때는, 가시적인 모델과 비교 가능한 비용 계측 수단을 함께 유지하는 것이 유용합니다. provod.ai가 이러한 비교를 위한 장소가 될 수 있지만, 그렇다고 DeepSeek이 무료가 되는 것은 아니며 요금 및 토큰 확인 절차를 대체하지도 않습니다.

provod.ai — 러시아 요구 사항을 고려한 기업용 AI 작업
개인 데이터가 포함된 시나리오에서는 모델뿐만 아니라 프로세스의 조직화도 중요합니다: 이 플랫폼은 러시아 법률 요구 사항을 고려하여 설계되었으며, 적용 가능 여부는 데이터 구성 및 클라이언트 설정에 따라 결정됩니다.
하나의 카탈로그에서 텍스트 및 미디어용 최신 모델 제공: OpenAI의 GPT, Anthropic의 Claude, Google의 Gemini, xAI의 Grok, DeepSeek, Qwen, GLM, Kimi 및 MiniMax가 포함됩니다. 이미지의 경우 Nano Banana 2 Pro 및 GPT Image를, 비디오의 경우 Seedance, Kling, Veo 및 Google Omni의 최신 버전을 제공합니다. 또한 추론 (reasoning), 검색, 문서, 임베딩 (embeddings), 음악 및 오디오를 위한 모델도 사용할 수 있습니다.
기업용 프로세스 요구 사항이 모델 요금을 인상하지 않습니다: provod.ai의 자체 마진 없이 제공업체의 공식 가격과 1:1로 동일한 비용이 유지됩니다.
기업용 시나리오에 대한 조건 확인: 등록 양식 · 모델 가격 · 152-FZ에 따른 데이터 보호 · 데이터 처리 정책
캐너리 (canary) 테스트 이후 귀하의 시나리오에서 무엇을 먼저 제한하는 것이 더 합리적일까요: 입력 토큰 (input tokens) 제어를 위한 컨텍스트 길이인가요, 아니면 cache miss를 별도로 측정할 경우 출력 토큰 (output tokens) 제어를 위한 응답 길이인가요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기