75개 기업이 밝힌 진짜 AI 비용 문제: 문제는 모델이 아니라 라우팅(Routing)이다
요약
75개 기업 조사 결과, 많은 기업이 적절한 모델 선택 대신 가장 비싼 모델을 기본값으로 사용하여 막대한 비용을 낭비하고 있습니다. 해결책은 작업 유형에 따라 최적의 모델을 자동으로 배정하는 '태스크 레벨 라우팅' 도입입니다.
핵심 포인트
- 기업들은 모델별 적합성을 몰라 가장 비싼 모델을 기본으로 사용하며 비용을 낭비함
- Uber 등 대기업도 AI 예산 소진 속도가 빠르며 지출과 성과 간 연관성 파악에 어려움을 겪음
- 단순히 저렴한 모델을 쓰는 것이 아니라 작업 성격에 맞는 모델 매칭이 핵심
- 태스크 레벨 라우팅 도입 시 품질 저하 없이 비용을 70% 가까이 절감 가능
YC(Y Combinator)의 지원을 받는 한 스타트업이 최근 모든 산업 분야에 걸친 75개 이상의 고객 상담 결과를 공유했습니다. 그 결과, 한 가지 주제가 다른 모든 것을 압도했습니다.
"모두가 어떤 모델을 사용해야 할지 모르기 때문에, 가장 비싼 모델을 기본값으로 사용한다."
이것은 기술적인 문제가 아닙니다. 라우팅 (Routing) 문제입니다. 그리고 이로 인해 기업들은 수백만 달러를 낭비하고 있습니다.
아무도 말하고 싶어 하지 않는 숫자들
그들이 발견한 내용은 다음과 같습니다:
- CFO(최고재무책임자)들은 AI를 단 하나의 항목으로 관리합니다 — 팀, 프로젝트 또는 에이전트별로 세분화되어 있지 않습니다.
- 토큰 (Token) 비용은 모든 재무 회의에서 클라우드 인보이스와 비교됩니다.
- Uber는 2026년 AI 예산 전체를 4개월 만에 소진했으며, 지출과 고객 성과 사이의 연관성을 찾지 못했습니다.
- 한 핀테크 기업은 사용 사례별 모델 선택 (per-use-case model selection)이 그들이 받은 요청 중 가장 영향력이 큰 요청이었다고 말했습니다.
결론이 무엇일까요? 그들이 대화한 모든 기업은 동일한 것을 원했습니다. 바로 어떤 모델이 어떤 작업에 적합한지 알 수 있는 방법입니다. 하지만 아무도 이를 가지고 있지 않습니다.
왜 "최대 성능 기본 설정"이 돈을 낭비하는가
어떤 모델이 어떤 작업에 적합한지 아무도 모를 때, 가장 합리적인 선택은 매번 가장 강력한 모델을 사용하는 것입니다.
저는 이 패턴을 직접 목격했습니다. 10개 이상의 AI 앱을 운영하면서, 저희의 Claude Code 청구액은 근본 원인을 파악하기 전까지 월 1만 달러에 달했습니다.
코딩 작업의 60-70%는 가장 비싼 모델을 필요로 하지 않습니다. 그들에게 필요한 것은 적절한 모델입니다.
저희의 실제 운영 워크로드(production workloads) 분석 결과는 다음과 같습니다:
| 작업 유형 | 대부분의 팀이 사용하는 것 | 실제로 작동하는 것 | 비용 차이 |
|---|---|---|---|
| 계획 및 아키텍처 (Planning & Architecture) | Fable 5 / Opus 4.8 | Opus 4.8 ✅ | 0% |
| ... |
이러한 낭비는 우연이 아니라 구조적인 문제입니다.
"그냥 더 저렴한 모델을 선택하세요"도 통하지 않습니다
이런 말을 자주 듣습니다. "그냥 모든 것에 Sonnet을 사용하세요."
하지만 이는 아키텍처 작업에서 무너집니다. 사려 깊은 시스템 설계 대신 얕은 스캐폴딩 (scaffolding)만 얻게 됩니다. "그냥 모든 것에 Haiku를 사용하세요."라고 하면 코드 리뷰에서 중요한 뉘앙스를 놓치게 됩니다.
진정한 해답은 **태스크 레벨 라우팅 (task-level routing)**입니다. 실제로 수행되고 있는 작업에 따라 각 코딩 작업을 적절한 모델에 자동으로 매칭하는 것입니다.
우리는 이를 워크플로우(workflow)에 통합했습니다. 그 결과: 월 $10,000 → 월 $3,000. 중요한 지표들인 테스트 통과율(test pass rates), PR 리뷰 정확도(PR review accuracy), 아키텍처 일관성 점수(architecture coherence scores) 측면에서 출력 품질은 동일하게 유지되었습니다.
모델을 하향 조정한 것이 아닙니다. 단지 더 스마트하게 배정(dispatch)했을 뿐입니다.
성숙도 격차는 엄청납니다
동일한 연구는 또 다른 패턴을 강조했습니다. 이 문제를 해결한 기업과 그렇지 못한 기업 사이의 격차가 빠르게 벌어지고 있다는 점입니다.
- 한 네오뱅크(neobank)는 AI를 미션 크리티컬(mission-critical) 운영에 도입했으며, AI 효율성 개선을 통해 확보한 자금만으로 **50~60%의 성장세 속에서도 채용 동결(hiring freeze)**을 유지하고 있습니다.
- 반면, 한 대형 에이전시의 AI 디렉터는 자신들이 **"준비되기까지 3~4년은 남았다"**라고 말했습니다.
차이는 예산이나 인재가 아닙니다. 바로 가시성(visibility)입니다. 네오뱅크는 어떤 모델이 어떤 워크플로우를 구동하는지, 작업당 비용이 얼마인지, 그리고 어디에서 낭비가 발생하는지를 정확히 알고 있습니다. 반면 에이전시는 AI를 그저 하나의 정체 모를 컴퓨팅 덩어리(amorphous blob of compute)로 취급합니다.
실제로 효과가 있는 방법 (우리가 비용을 70% 절감하며 얻은 교훈)
다음 네 가지를 순서대로 실행하십시오:
1. 작업 유형별로 모델 사용량을 감사(Audit)하십시오.
대부분의 팀은 실제로 이를 한 번도 해본 적이 없습니다. Opus나 Fable이 Haiku로도 완벽하게 처리할 수 있는 작업에 얼마나 많이 사용되고 있는지 알게 되면 충격을 받을 것입니다.
2. "Opus 작업"과 "Haiku 작업"을 식별하십시오.
우리의 포트폴리오에서는 대략 30/70 비율입니다. 귀사의 상황은 다를 수 있지만, 핵심은 이러한 분리가 존재한다는 점입니다.
3. 자동으로 라우팅(Route)하십시오.
수동 모델 선택은 단일 개발자 단계를 넘어서면 확장(scale)할 수 없습니다. 인간의 개입 없이 작업을 분류하고 적절한 모델로 배정(dispatch)하는 시스템이 필요합니다.
4. 작업별 품질을 측정하십시오.
출력 품질이 저하된다면 비용 절감은 아무런 의미가 없습니다. 단순히 "완료되었는가"가 아니라 "잘 완료되었는가"와 같이 각 작업 유형에 중요한 지표들을 추적하십시오.
결론
AI 비용 게임에서 승리하고 있는 기업들은 최고의 프롬프트를 가졌거나, 가장 큰 예산을 보유했거나, 가장 최신 모델을 사용하는 기업들이 아닙니다.
그들은 모델 선택은 지출의 문제가 아니라 라우팅(routing)의 문제라는 것을 깨달은 기업들입니다.
해당 연구의 CFO는 AI 지출이 광고비 지출처럼 정밀하게 추적되기를 원했습니다. 즉, 모든 달러의 용처가 할당되고 모든 채널이 측정되는 방식입니다. 동일한 규율이 AI 분야에도 적용되고 있습니다. 문제는 여러분이 이를 선제적으로 구축할 것인지, 아니면 청구서를 보고 깜짝 놀랄 것인지입니다.
저는 10개 이상의 AI 기반 앱 포트폴리오를 운영하고 있으며, AI 비용을 실제로 변화시키는 요소들에 대해 글을 씁니다. 이전에는 작업 수준의 라우팅 (task-level routing)을 통해 팀의 AI 코딩 비용을 월 1만 달러에서 3천 달러로 절감했습니다. X @aplomb2에서 저를 찾아보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기