$0.13의 API 토큰: AI 접속을 위한 지하 중계 시장 내부 들여다보기
요약
Anthropic과 OpenAI의 API 토큰을 정가 대비 97% 이상 할인된 가격에 판매하는 조직적인 AI API 중계 시장의 실태를 분석합니다. 도난 카드와 계정 남용을 이용한 4단계의 정교한 지하 경제 구조를 다룹니다.
핵심 포인트
- 공식 가격 대비 약 97.8% 할인된 API 토큰이 유통되는 지하 시장 존재
- 도난 카드, 무료 체험 계정 등을 이용한 4단계의 조직적 공급망 구조
- 계정 판매상부터 중계소까지 이어지는 정교한 AI API 중계 생태계
- API 게이트웨이 남용을 통한 비정상적인 수익 모델의 경제학적 분석
이해하기 어려운 숫자가 하나 있습니다. 3,333달러 상당의 공식 Anthropic API 크레딧이 425위안에 판매되었습니다. 이는 약 59달러입니다.
구매자는 59달러를 지불하고 프론티어 모델 (Frontier models)에 대한 3,000달러 이상의 API 접속 권한을 얻습니다. 실질적인 비율은 다음과 같습니다: 1달러 지출당 공식 사용량 약 0.13달러 -- 정가 대비 97.8% 할인된 가격입니다.
이것은 공동 구매 할인이나 스타트업 혜택이 아닙니다. 이것은 AI API 토큰을 중심으로 성장한 4단계의 지하 경제인 '중계 시장 (Relay market)'이며, 이는 대부분의 개발자가 인식하는 것보다 더 크고 조직적입니다.
중계(Relay)란 무엇인가?
중계(Relay) -- 이 경제가 운영되는 중국어 포럼에서는 '전송 스테이션 (Transfer station)'이라고도 불림 -- 는 미국에 호스팅된 AI 모델로의 API 트래픽을 대폭 할인된 가격으로 프록시 (Proxy) 해주는 서비스입니다. 공식 엔드포인트 (Endpoint) 대신 중계업체의 엔드포인트로 OpenAI 호환 SDK를 설정하면, 귀하의 요청은 중계 운영자가 제어하는 계정 풀 (Pool of accounts)을 통해 전달됩니다.
할인이 발생하는 이유는 AI 제공업체가 API 접속에 부과하는 비용과 이 운영자들이 실제로 지불하는 비용 사이의 격차 때문입니다. 만약 도난당한 신용카드, 대량으로 등록된 무료 체험 계정, 또는 차지백 차익 거래 (Chargeback arbitrage)를 이용한다면, 토큰당 비용은 0에 수렴합니다. 이 토큰들을 정가의 90% 할인된 가격에 판매하더라도 여전히 상당한 마진을 남길 수 있습니다.
저는 Anthropic 및 OpenAI API를 직접 포함하여 여러 제공업체 백엔드를 사용하는 Hermes Agent를 통해 개인용 AI 에이전트 인프라를 운영하고 있습니다. 제가 중계 시장에 대해 처음 읽었을 때, 저의 반응은 도덕적 분노가 아니라 경제학에 대한 호기심이었습니다. 작동해서는 안 되는 무언가를 바탕으로 어떻게 비즈니스 모델을 구축할 수 있을까요? 그 답은 놀라울 정도로 정교한 공급망 (Supply chain)과 관련이 있다는 것이 밝혀졌습니다.
4단계 경제 구조
이 중계 생태계는 원천 자격 증명 (Credentials)을 조달하는 사람들부터 저렴한 추론 (Inference)을 구매하는 개발자들에 이르기까지 4단계의 계층 구조로 운영됩니다. AI 게이트웨이 남용 (Gateway abuse) 분야에서 수년간 연구해 온 보안 연구원 Matt Lenhard는 운영자들이 자신들의 수법을 공개적으로 논의하는 중국어 포럼을 우연히 발견한 후, 이 구조를 상세히 기록했습니다.
1단계: 카드 및 계정 판매상 (卡商/号商). 이들은 상류 (Upstream) 공급업체입니다. 미국 및 유럽의 결제 확인을 통과하도록 설계된 가상 신용카드와 대량으로 등록된 AI 제공업체 계정을 판매합니다. 일부 카드는 선불 카드이며, 일부는 도난된 카드입니다. 판매상들은 그 종류가 무엇인지 거의 신경 쓰지 않습니다.
2단계: 계정 풀 (账号池). 풀 (Pool)은 수십 또는 수백 개의 상류 계정을 하나로 모으고, 인증 토큰 (Authentication tokens)과 속도 제한 (Rate limits)을 관리하며, 계정이 차단될 경우 페일오버 (Failover)를 처리하고, 단일 API 접점을 노출합니다. 재고는 OpenAI, Anthropic, Google의 직접적인 자격 증명에 국한되지 않습니다. 모델을 재판매하거나 하위 모델을 노출하는 Kiro 및 antigravity와 같은 소비자용 제품 등 애플리케이션 계층 (Application layer)에서 수집된 계정도 포함됩니다. 풀 운영자에게 모델 접근 권한을 부여하는 토큰이라면 무엇이든 사냥의 대상입니다.
3단계: 중계소 / 전송 스테이션 (中转站). 이들은 소비자 대상 계층입니다. 풀의 API를 깔끔한 제품으로 감싸고(Wrap), 결제 및 송장 발행을 처리하며, 고객 지원용 WeChat 그룹을 운영하고, 가격으로 경쟁합니다. 최종 사용자가 실제로 상호작용하는 대상은 바로 이 중계소입니다.
4단계: 최종 사용자. 구매자에는 저렴한 추론을 찾는 중국 개인 개발자, 소규모 스타트업, 중소 규모의 SaaS 기업들이 포함됩니다. 수요의 상당 부분은 모델 증류 (Model distillation) 작업에서 발생합니다. 즉, 프런티어 모델 (Frontier models)에 대한 저렴한 중계 접속을 사용하여 자국 내 대체 모델을 훈련하는 것입니다.
실제로는 이러한 계층 간의 경계가 모호합니다. 많은 운영자가 풀과 중계소를 모두 운영합니다. 포럼 참여자들 스스로도 이 용어들을 혼용하여 사용하는 경우가 많습니다.
소프트웨어 스택 (Software Stack)
거의 모든 중계소는 one-api 또는 new-api라는 두 가지 오픈 소스 프로젝트 중 하나를 기반으로 운영됩니다.
두 프로젝트 모두 Go 언어로 작성된 OpenAI 호환 게이트웨이 (gateway)입니다. 운영자는 패널을 배포하고 채널 (channel)을 설정합니다. 각 채널은 제공업체(provider)와 API 키 풀 (pool)을 나타냅니다. 패널은 OpenAI API 형식과 일치하는 단일 엔드포인트 (endpoint)를 노출합니다. 구매자는 기존의 SDK를 중계소의 URL로 지정하기만 하면 됩니다. 모든 요청에 대해, 게이트웨이는 풀에서 키를 하나 가져와서, 요청을 상위 서버 (upstream)로 전달하고, 응답을 반환하며, 사용량에 배수를 곱한 가격으로 할당량 (quota)을 차감합니다.
new-api는 one-api의 더 활발하게 개발되는 포크 (fork) 버전입니다. 주요 차이점은 주로 상업적 기능에 있습니다. new-api는 셀프 서비스 결제 및 충전 기능과 더불어 이미지, 비디오, 오디오 모델 지원 기능을 포함하고 있습니다. Lenhard의 연구에서 추적된 중계소들을 살펴보면, one-api가 new-api보다 약 4배 더 자주 나타나지만, 판매를 위해 만들어진 것은 new-api입니다.
이 소프트웨어 자체에는 본질적으로 불법적인 요소가 없습니다. 수많은 합법적인 기업들이 팀별 할당량과 지출 추적 기능을 갖춘 단일 게이트웨이 뒤에 자체 계정들을 배치하기 위해 one-api를 셀프 호스팅 (self-host)합니다. 중계소가 선을 넘는 지점은, 채널이 운영자 자신의 키가 아닌 도난당했거나 유출되었거나 혹은 공유된 키들로 채워질 때입니다.
방법론 (The Methods)
중계 운영자들은 비용을 거의 제로에 가깝게 유지하기 위해 몇 가지 기술을 사용합니다:
-
무료 체험 남용 (Free-trial abuse). 대량으로 계정을 자동 생성하여 무료 크레딧을 챙긴 뒤, 해당 트래픽을 최종 사용자에게 프록시 (Proxy)로 전달합니다. 이는 가장 오래된 수법이며, AI 제공업체들이 경쟁을 위해 진입 장벽이 낮은 온보딩 (Onboarding)을 필요로 하기 때문에 여전히 유효합니다.
-
차지백 공격 (Chargeback attacks). 정상적인 사용량을 쌓은 뒤, 결제 주기가 끝나면 지불된 금액을 환불(Chargeback) 요청합니다. 제공업체는 비용을 떠안게 되고, 운영자는 토큰을 챙깁니다.
-
도난된 선불 카드 (Stolen prepaid cards). 초기 검증 절차는 통과하지만 추적이 불가능한 가상 선불 카드로 계정에 자금을 충전합니다.
-
오픈 추론 남용 (Open inference abuse). 엄격한 가드레일 (Guardrails)이 없는 모든 지원용 챗봇이나 API 엔드포인트 (Endpoint)는 트래픽 프록시의 표적이 됩니다. 공격자는 피해자의 API 키를 자신의 릴레이 풀 (Relay pool)에 삽입하고 이를 통해 요청을 라우팅 (Routing)합니다.
-
지갑 거부 (Denial of wallet). 비교적 새로운 패턴으로, 제공업체의 비용을 소진시키기 위한 목적으로 순수하게 대량의 동시 요청을 퍼붓는 방식입니다. 여기에는 사보타주 (Sabotage, 파괴 행위) 외에 금전적 동기는 없습니다.
Lenhard는 자신의 연구에서 한 가지 중요한 세부 사항을 언급합니다: 재고는 직접적인 연구소 계정에만 국한되지 않습니다. OpenAI, Anthropic, Google 자격 증명과 더불어, 이 모델들에 대한 접근 권한을 재판매하는 소비자용 AI 제품에서 수집된 계정들도 풀 (Pool)에 포함되어 있습니다. 만약 어떤 앱이 프런티어 모델 (Frontier model)을 래핑 (Wrap)하여 API를 노출한다면, 그 API는 표적이 됩니다.
이 시장은 얼마나 큰가?
대부분의 미국 개발자들이 들어본 적도 없는 이 지하 경제의 규모는 놀라운 수준입니다.
Vectoral이 추적한 트래픽 상위 10개 릴레이 (Relay)는 합계 월간 360만 회의 방문을 기록하고 있습니다. 릴레이를 위한 가격 비교 사이트도 존재하며, 이용 가능한 운영자와 그들의 요율을 나열합니다. 제휴 프로그램도 있으며, 심지어 일일 복권까지 존재합니다.
네, 복권입니다. 스스로를 중계 진위 확인 서비스(relay authenticity checker)라고 홍보하는 hvoy.ai 사이트는 50개의 100달러 상당 API 키를 대상으로 매일 추첨을 진행합니다. Lenhard가 확인한 날에는 258명이 50개의 키를 얻기 위해 401장의 티켓을 투입했습니다. 이 추첨은 증명 가능한 공정성 (provably fair) 체계를 사용하는데, 이는 합법적인 암호화폐 도박 사이트들이 사용하는 것과 동일한 암호학적 접근 방식입니다. 난수 시드 (random seed)는 최신 비트코인 블록의 해시 (hash) 값입니다. 당첨자는 부분 피셔-예이츠 셔플 (Partial Fisher-Yates shuffle) 방식으로 선정됩니다. 전체 참가자 명단은 매 추첨 전 스냅샷 형태로 공개됩니다.
가격 비교, 제휴 프로그램, 그리고 증명 가능한 공정성을 갖춘 복권까지 존재하는 이 시장은 단순한 비주류 운영이 아닙니다. 이는 인프라를 갖춘 성숙한 회색 경제 (gray economy)입니다.
누가, 왜 구매하는가
구매자는 세 가지 범주로 나뉩니다:
-
비용에 민감한 개발자 (Cost-sensitive developers): 미국의 API 가격이 감당하기 어려운 수준인 지역의 개발자들입니다. Anthropic 접속을 위해 정가의 13%($0.13)만 지불하는 중국의 1인 개발자는 가격 경쟁력을 바탕으로 글로벌 시장에서 경쟁할 수 있는 제품을 만들 수 있습니다.
-
SaaS 기업: 대규모로 추론 (inference)을 실행하는 기업들입니다. 하루에 수백만 건의 요청을 처리하는 스타트업에게 공식 가격과 중계 가격의 차이는 수익과 손실을 가르는 결정적인 차이입니다.
-
모델 증류자 (Model distillers): 이들은 전략적으로 가장 중요한 범주입니다. 프런티어 모델 (frontier models)에 대한 저렴한 중계 접속은 대규모 증류 파이프라인 (distillation pipelines)을 운영하는 것을 경제적으로 가능하게 만듭니다. 즉, GPT-5, Claude Opus, 또는 Gemini의 출력을 사용하여 더 작은 오픈 웨이트 (open-weight) 대안 모델을 학습시키는 것입니다. Lenhard의 연구에 포함된 포럼 인용구에 따르면, 업계의 증류자들은 이러한 방식으로 수백만 달러를 벌어들였다고 주장합니다.
개발자의 관점에서 보면 그 매력은 명확합니다. 나는 내 API 계정을 통해 Anthropic에 직접 비용을 지불합니다. 반면 정가(list price)의 3%만 청구하는 중계 운영자는 엄청난 혜택처럼 보입니다. 물론 함정은 신뢰성 보장이 없고, SLA(서비스 수준 협약)도 없으며, 실제로 돈을 지불한 모델을 제대로 받고 있는지 알 방법이 없다는 점입니다. 포럼에서 반복되는 불만 사항은 중계업자들이 몰래 더 저렴한 모델로 대체한다는 것입니다. 즉, Opus 비용을 청구하고 Sonnet을 제공하는 식인데, 구매자는 이를 확인할 방법이 없습니다.
이것이 우리 모두에게 의미하는 바
만약 당신이 AI API를 기반으로 제품을 구축한다면, 당신이 이 시장에 참여하든 안 하든 이 시장은 당신에게 영향을 미칩니다.
첫째, 가격 압박입니다. 당신의 경쟁사 중 상당수가 당신의 API 비용 3% 수준으로 동일한 모델에 접근할 수 있다면, 당신은 추론 비용(inference cost)에 기반하지 않은 해자(moat)를 찾아내거나, 아니면 패배하게 됩니다. 이는 이미 중국의 AI 스타트업 생태계에서 벌어지고 있는 일입니다. 중계(relay)를 통한 비용 우위는 서구 기업들이 가격 면에서 경쟁하기 힘든 저가(low-price) AI 제품의 물결을 가속화했습니다.
둘째, 보안 외부효과(security externalities)입니다. 중계 수요는 AI 제공업체에 대한 사기 행위—도난 카드, 대량 계정 생성, 차지백(chargeback) 조직—를 조장합니다. 제공업체들은 이러한 비용을 더 높은 가격과 더 엄격한 속도 제한(rate limits)을 통해 정당한 고객들에게 전가합니다. 모든 차지백 사기 사건은 모두를 위한 진입 장벽을 높입니다. 우리는 이미 이를 목격하고 있습니다. Anthropic과 OpenAI는 무료 티어(free-tier) 제한을 꾸준히 강화하고 더욱 공격적인 남용 탐지(abuse detection) 기능을 도입해 왔습니다.
셋째, 대규모 증류(distillation at scale)입니다. 중계 접속을 통해 프런티어 모델(frontier models)로부터 훈련 데이터를 저렴하게 추출할 수 있는 능력은 오픈 웨이트(open-weight) AI 개발의 경쟁 역학을 변화시킵니다. 10,000달러 상당의 중계 크레딧을 가진 팀은 공식 API 가격으로는 300,000달러 이상이 들었을 증류 파이프라인(distillation pipelines)을 실행할 수 있습니다. 이것을 민주화로 볼 것인지 아니면 지식 재산권(intellectual property) 절도로 볼 것인지는 관점에 따라 다르겠지만, 어찌 되었든 이 현상은 일어나고 있습니다.
넷째, 신뢰의 침식 (trust erosion). 중계 시장은 근본적인 신뢰 문제를 야기합니다. 만약 제가 Anthropic의 API를 사용하여 프로덕션 서비스 (production service)를 운영하는 정당한 개발자라면, 제 API 키가 중계 풀 (pool)로 유출되지 않았음을 어떻게 확신할 수 있을까요? 제가 의존하고 있는 고객 지원 챗봇 (support chatbot)이 중계를 통해 트래픽을 프록시 (proxying)하고 있지 않다는 것을 어떻게 알 수 있을까요? 정당한 다중 계정 관리 (multi-account management)와 중계 참여 사이의 경계는 업계가 인정하고 싶어 하는 것보다 훨씬 더 모호합니다.
제공업체들의 대응 방식
Lenhard가 설명하고 Hacker News의 논의를 통해 확인된 중계 사기에 대한 방어 전략 (defense playbook)은 다음과 같습니다:
-
진입 비용 높이기. 계정을 대량으로 생성하기 어렵게 만듭니다. 신규 계정의 지출 한도를 제한합니다. 어떠한 마찰 (friction)이라도 공격자의 비용을 높입니다.
-
자금 흐름 감시. 선불 카드, 가상 카드, 불일치하는 결제 정보, 그리고 소액의 카드 테스트 결제 (card-testing charges)를 탐지합니다. 결제 신호 (payment signals)는 행동 신호 (behavioral signals)보다 위조하기가 더 어렵습니다.
-
행동 패턴 감시. 실제 사용자는 생성하지 않는 패턴을 찾습니다: 가입부터 첫 토큰 생성까지의 시간, 모델 선택 패턴, 프롬프트 관련성 (prompt relevance), 계정 생성 기간, 그리고 IP 신호 (프록시, VPN, 국가 기원) 등을 확인합니다.
-
계정 클러스터링 (Cluster the accounts). 서로 다른 계정들이 실제로는 하나의 운영자에게 연결되어 있음을 보여주는 IP 시빌 (IP sybils) 및 공유된 기기 지문 (device fingerprints)을 감시합니다.
-
비정상적 비용 모니터링. 안전장치로서 지출 알림 (spend alerts)을 설정합니다.
이 문제를 다루는 사람들의 솔직한 평가는 다음과 같습니다: 이러한 조치 중 그 어느 것도 남용을 영구적으로 막을 수는 없습니다. 이 시장의 사기는 끊임없는 쫓고 쫓기는 게임 (cat-and-mouse game)입니다. 모든 탐지 기술은 결국 우회됩니다. 목표는 남용을 완전히 제거하는 것이 아니라, 공격자가 서비스를 공격하는 비용을 충분히 높여서 공격의 경제성이 사라지게 만드는 것입니다.
나의 생각
저는 지난 2년 동안 AI API를 사용하여 프로덕션 시스템을 구축해 왔습니다. 중계 시장에 대해 저에게 가장 인상 깊었던 점은 사기 그 자체가 아니라, 이 시장이 드러내는 인프라의 격차 (infrastructure gap)였습니다.
AI 제공업체들은 사치재를 원자재 가격(commodity pricing)으로 판매하고 있습니다. 이들의 구독 플랜은 고정된 요금으로 무제한 사용을 제공하고, 무료 티어(free tiers)는 실제 연산 자원(compute)을 무상으로 제공하며, API 가격은 비용 곡선(cost curves)이 정당화하는 속도보다 더 빠르게 하락하고 있습니다. 이 모든 것은 지속 가능성이 아닌 시장 점유율을 위해 설계되었습니다. 중계 시장(relay market)은 경제적 인센티브와 기술적 통제(technical controls)가 서로 어긋날 때 발생하는 현상입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기