OpenAI가 모델 가격을 80% 인하했으나 아무에게도 알리지 않았습니다. 가격 추적기를 운영하는 저조차 알아차리는 데 23일이 걸렸습니다.
요약
OpenAI가 GPT-5.6 Luna 모델의 API 가격을 사전 공지 없이 80% 인하했으나, 이를 포착하는 데 23일이 소요되었습니다. API 가격 책정에는 변경 로그나 알림 시스템이 부재하여 사용자가 직접 가격 변동을 추적해야 하는 리스크가 있음을 시사합니다.
핵심 포인트
- OpenAI가 GPT-5.6 Luna 모델 가격을 80% 인하함
- 공지사항, 변경 이력, 이메일 등 어떠한 사전 안내도 없었음
- 주요 AI 벤더들은 API 가격 변경에 대한 공식적인 로그를 제공하지 않음
- 비용 추정이 중요한 서비스 개발 시 직접적인 가격 모니터링 필요
7월 9일 이후 어느 시점에, OpenAI는 GPT-5.6 Luna의 가격을 100만 토큰당 $1.00/$6.00에서 $0.20/$1.20로 변경했습니다.
이는 현재의 프런티어급 (frontier-tier) 모델에 대한 80% 인하입니다. 어떠한 공지사항도 없었습니다. 변경 이력 (changelog) 기록도 없었습니다. 이메일도 없었습니다. 가격 페이지가 어느 날 조용히 다른 내용을 표시했을 뿐입니다.
저는 모든 주요 제공업체의 LLM API 가격을 추적하는 사이트를 운영하고 있습니다. 저는 23일 동안 알아차리지 못했습니다. 제 자체 추적기는 그 기간 내내 이전의 더 높은 수치를 계속 게시하고 있었습니다.
이 실수가 왜 발생했는지에 대해 이야기하고 싶습니다. 왜냐하면 그 이유가 실수 자체보다 더 흥미롭기 때문입니다.
실제로 변경된 내용
동일한 제품군 내의 두 모델이 같은 변화의 영향을 받았습니다:
| 모델 | 입력 (이전 → 현재) | 출력 (이전 → 현재) | 혼합 (Blended) | 변화 |
|---|---|---|---|---|
| GPT-5.6 Luna | $1.00 → $0.20 | $6.00 → $1.20 | $2.25 → $0.45 | −80% |
| ... | ||||
혼합 (Blended) 수치는 입력 3대 출력 1의 비율로, 이는 실제 채팅이나 RAG (Retrieval-Augmented Generation) 워크로드와 대략 일치합니다. 단순한 입력/출력 평균값은 저렴한 입력 모델을 실제보다 더 나쁘게 보이게 만듭니다.
다음 세 가지 사항이 제가 페이지를 잘못 읽은 것이 아니라 실제 벤더 (vendor)의 변경임을 확신하게 했습니다:
- 배치 (Batch) 및 플렉스 (Flex) 티어가 정확히 동일한 보폭으로 움직였습니다 — 두 티어 모두 이전과 동일한 관계를 유지하며 정확히 표준 요율의 절반으로 내려갔습니다. 스크래핑 (scraping) 오류는 내부 비율을 유지하지 못합니다.
- Sol은 전혀 움직이지 않았습니다. 파싱 (parsing) 오류가 발생했다면 제품군 내의 세 행 모두가 망가졌을 것이지, 두 개만 망가졌을 리 없습니다.
- 이전 수치들은 7월 9일에 이미 두 곳의 소스를 통해 검증되었습니다. 변경 전 상태는 추측이 아니었습니다.
결론적으로: 실제 인하가 있었고, 조용히 배포되었습니다.
왜 아무도 포착하지 못했는가
타인의 가격 책정에 의존하는 무언가를 구축하고 있다면, 이 부분이 여러분의 주의를 끌 가치가 있습니다.
API 가격 책정에 대한 변경 로그 (changelog)는 존재하지 않습니다. OpenAI도, Anthropic도, Google도 마찬가지입니다. 가격 페이지가 있고, 숫자가 표시되며, 그 숫자는 오늘 현재의 값일 뿐입니다. 버전 기록도, RSS 피드도, 웹훅 (webhook)도, 폐지 공지 (deprecation notice)도 없습니다. 무엇이 변했는지 알고 싶다면, 이전에 무엇이었는지 직접 기록해 두어야만 합니다.
저의 경우 세 가지 별도의 안전망이 동시에 작동하지 않았으며, 이는 매우 교훈적인 방식으로 실패했습니다:
- 커뮤니티 데이터셋에 포함되지 않았습니다. 수많은 툴링 (tooling)이 가격 정보를 위해 조용히 의존하고 있는 LiteLLM은
gpt-5.6-*항목을 한 번도 보유한 적이 없습니다. 만약 여러분의 비용 추정치가 커뮤니티 가격 맵 (price map)에서 나온다면, 데이터의 부재가 마치 변화가 없음과 똑같이 보인다는 점을 명심해야 합니다. - 저의 주간 검증 스윕 (verification sweep) 대상에 포함되지 않았습니다. 이 스윕은 퍼스트 파티 (first-party) 가격 페이지를 기준으로 순환하는 모델 바스켓 (basket)을 재확인합니다. Luna는 그 바스켓에 없었습니다. 스윕 자체에는 문제가 없었습니다. 단지 그곳을 보고 있지 않았을 뿐입니다.
- 알고 있었던 유일한 시스템이 저에게 무용지물인 정보를 알려주었습니다. 저는 정확히 이 모델에 대해 "여기 잘못된 가격이 있어도 보이지 않을 것"이라는 경고를 내보내는 커버리지 트리와이어 (coverage tripwire)를 가지고 있었습니다. 하지만 시스템은 375줄에 달하는 경고 벽 속에 그 내용을 출력한 뒤, LiteLLM이 보유하지도 않은 모델을 LiteLLM ID 파일에 매핑하여 문제를 해결하라고 제안했습니다. 해결책이 불가능한 경고는 경고가 아닙니다. 그것은 죄책감을 가진 소음일 뿐입니다.
제가 이번 일을 통해 실제로 얻은 교훈은 다음과 같습니다: 이미 존재하지만 무시되고 있는 신호는 탐지 (detection)의 문제가 아니라 집행 (enforcement)의 문제입니다. 저에게는 더 나은 탐지기가 필요했던 것이 아닙니다. 기존의 탐지기가 정중하게 로그를 남기는 대신, 요란하게 실패를 알려줄 필요가 있었습니다. 아무도 읽지 않는 로그에 한 줄을 추가하는 대신 빌드를 깨뜨려 버리는 트리와이어를 만드는 것 — 바로 그 수정 사항이 가격 수정과 함께 배포되었습니다.
6주간의 추적이 실제로 보여주는 것
저는 모든 제공업체의 모든 가격을 매일 기록해 왔기에, 단일 가격 페이지에서는 명확히 드러나지 않는 시장에 대한 몇 가지 사실을 말할 수 있습니다.
현재 최첨단 지능 (Frontier intelligence)의 비용은 100만 토큰당 $4.66입니다.
이는 OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba, Mistral, Z.AI, 그리고 Moonshot까지 9개의 서로 다른 연구소에서 나온 9개의 최첨단 모델 (frontier models)을 대상으로 산출한 동일 가중치 연쇄 지수 (equal-weighted, chain-linked index)입니다. 이 지수는 2월 말 이후 3.7% 하락했으며, 지난 7일 동안은 완전히 정체된 상태를 유지했습니다.
해당 바스켓(basket)에서 발견한 세 가지 놀라운 사실은 다음과 같습니다:
1. 저가형 모델은 터무니없이 저렴하며, 성능이 나쁘지도 않습니다. DeepSeek V4 Pro의 혼합 가격 (blended price)은 $0.544로, GPT-5.6 Sol의 $11.25와 비교하면 대략 20분의 1 수준입니다. 성능 면에서는 Sol의 83.8점 대비 Vellum 리더보드에서 71.5점을 기록했습니다. 이를 벤치마크 점수당 비용으로 정규화하면, DeepSeek는 지수 평균인 $0.0637 대비 점수당 $0.0076의 비용이 듭니다. 이는 평균적인 최첨단 모델보다 약 8배 더 비용 효율적입니다. 마지막 12점의 벤치마크 점수가 20배의 가격 프리미엄을 지불할 가치가 있는지는 실제 엔지니어링 측면의 결정 사항이며, 대부분의 팀은 이를 명시적으로 결정하지 않습니다.
2. 오픈 웨이트 (Open weights) 모델이 더 저렴하지만, 차이가 크지는 않습니다. 바스켓 내 오픈 웨이트 모델의 평균 혼합 가격은 $4.08이며, 폐쇄형 (closed) 모델의 평균은 $4.83입니다. 이는 100만 토큰당 75센트의 차이로, '오픈 소스는 기본적으로 무료'라는 직관이 시사하는 것보다 훨씬 좁은 격차입니다. 만약 오픈 웨이트 모델을 선택한다면, 토큰 가격 때문이 아니라 이식성 (portability)과 미세 조정 (fine-tuning)을 위해 선택해야 합니다.
3. 최첨단 모델의 교체 주기가 놀라울 정도로 빠릅니다. 2주 동안 이 바스켓에는 다섯 번의 모델 교체가 있었습니다: GPT-5.5 → GPT-5.6 Sol, Grok 4 → Grok 4.5, Claude Opus 4.8 → Opus 5, Qwen3-Max → Qwen3.7-Max, 그리고 Kimi K3가 새로운 구성원으로 진입했습니다. 14일 만에 9개 슬롯 중 5개가 바뀌었습니다. 한 달 전에 구축한 비용 모델은 더 이상 현재 존재하지 않는 모델들을 설명하고 있을 것입니다.
사람들이 잊고 있는 사실은 가격이 양방향으로 움직인다는 점입니다. 동일한 기간 동안 Mistral은 Mixtral 8x7B Instruct의 가격을 29.6% ($0.54 → $0.70) 인상했으며, Mistral Small 3.2 24B는 36.4% ($0.08/$0.20 → $0.10/$0.30) 인상했습니다. 이 역시 아무도 발표하지 않았습니다.
이에 대해 실제로 취해야 할 조치
노력의 정도에 따라 대략적인 순서대로 나열하면 다음과 같습니다:
비용 모델에 날짜와 함께 가격을 고정하세요. "GPT-5.6 Luna 비용은 $1입니다"라고 적지 말고, "2026-07-09 기준으로 GPT-5.6 Luna 비용은 $1.00/$6.00입니다"라고 적으세요. 기준 날짜가 없는 비용 추정치는 사실인 척하는 숫자에 불과합니다. 이것은 여기서 가장 가치 있는 습관이며, 비용도 들지 않습니다.
해당 숫자에 의존하는 모든 작업 전에 다시 확인하세요. 예산 승인, 모델 선택 결정, 고객 대상 가격 책정 등이 이에 해당합니다. 제가 직접 겪으며 깨달은 것처럼, 3주 전의 캐시된(cached) 수치보다는 벤더(vendor)의 자체 가격 페이지를 확인하는 5분이 훨씬 낫습니다.
커뮤니티 가격 지도(price map)를 절대적인 진실의 원천으로 신뢰하지 마세요. 그것들은 정말 유용하고 좋은 사람들이 관리하고 있지만, 누락된 범위(coverage gaps)는 소리 없이 존재합니다. 목록에 없는 모델은 누락된 것처럼 보이지 않고, 보고할 내용이 없는 것처럼 보이기 때문입니다.
실제 비율을 사용하여 혼합 비용(blended cost)을 계산하세요. 50k 토큰을 읽고 500 토큰을 쓰는 요약기(summarizer)는 끊임없이 생성하는 에이전트 루프(agent loop)와 완전히 다른 경제성을 가집니다. 광고된 "저렴한" 모델은 당신이 어떤 용도로 사용하느냐에 따라 결과가 뒤집힙니다.
프롬프트 캐싱(prompt caching)이 결과에 영향을 미치는지 확인하세요. 에이전트, RAG, 긴 채팅 등 동일한 컨텍스트를 반복해서 읽는 모든 작업에서, 캐싱된 입력 요율(cached input rates)은 헤드라인 가격보다 순위를 더 크게 바꿀 수 있습니다. 이는 이러한 비교에서 가장 흔히 무시되는 변수입니다.
불편한 결론
저는 이러한 종류의 문제를 포착하기 위해 특별히 도구를 만들었음에도 불구하고, 업계 최대 제공업체의 현재 모델에 대한 80% 가격 인하를 발견하는 데 여전히 23일이 걸렸습니다.
이것은 제 도구가 나쁘다는 이야기가 아닙니다. 이 생태계의 얼마나 많은 부분이 실제로 아무도 지켜보지 않는 숫자들로 운영되고 있는지에 대한 이야기입니다. 일일 스냅샷과 검증 작업을 수행하는 전용 추적기조차 잘못된 가격을 3주 동안 유지할 수 있다면, 당신이 6월에 단위 경제성(unit economics)을 모델링했던 스프레드시트의 상태도 별반 다르지 않을 것입니다.
가격 옆에 날짜를 적으세요. 그것이 이 글의 핵심입니다.
위의 지표들은 modelpricewatch.com/price-index에서 실시간으로 확인할 수 있으며, 전체 방법론 (full methodology)과 월간 LLM 가격 현황 (State of LLM Pricing) 보고서가 제공됩니다. 모든 가격은 캡처된 타임스탬프와 함께 해당 가격이 추출된 벤더 (vendor) 페이지로 연결됩니다.
공개 사항: 저는 ModelPriceWatch를 운영하고 있습니다.
여러분의 비용 모델 (cost model)에 여전히 남아 있는 가장 오래된 가격은 무엇인가요? 지금 확인해 보세요. 얼마나 많은 분이 오래된 정보를 발견하게 될지 진심으로 궁금합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기