AI 제품 개발 방식의 변화를 가져온 90% 가격 인하
요약
AI 모델의 추론 및 운영 비용이 급격히 하락하고 있습니다. Anthropic과 OpenAI 같은 주요 공급업체들이 소형 모델의 가격을 대폭 인하하며, 시장은 이제 저렴한 소형 모델을 기본 작업 수준으로 규정하고 있습니다. 이로 인해 에이전트 기반 작업에서 라우팅 전략의 중요성이 커지고 있습니다.
핵심 포인트
- AI 추론 비용이 급격히 하락하여 제품 개발 방식에 변화를 예고합니다.
- Anthropic과 OpenAI가 소형 모델 가격을 대폭 인하하며 시장 표준을 낮추고 있습니다.
- 저렴한 소형 모델의 성능 향상으로 에이전트 기반 작업에서 라우팅 전략이 중요해졌습니다.
2025년 1월, GPQA Diamond에서 75% 점수를 받은 모델은 질문당 약 30센트가 들었습니다. 18개월 후 같은 점수를 얻는 모델은 4분의 1센트에 불과했습니다 (출처: Epoch AI, 2026). 이는 기계 추론(machine reasoning) 가격이 725배 하락한 수치이며, 대부분의 제품 팀들이 어떤 모델을 선택할지 논쟁하던 기간 동안 발생했습니다.
비용 곡선이 성능 곡선보다 가파르다
Epoch AI의 경제학자들은 3년간의 모델 출시를 통해 다섯 가지 주요 벤치마크를 추적했으며, 특정 수준의 정확도를 유지하는 데 드는 비용이 분기별로 약 47%씩 하락했고, 이는 연간으로 환산하면 대략 13배에 달했습니다 (출처: Epoch AI, 2026). 비교하자면, 이 속도는 DNA 시퀀싱보다 약 네 배 빠르고, 컴퓨팅(compute)보다 여섯 배 빠르며, 리튬 배터리보다 18배 빠른 수치입니다.
이러한 하락세는 모델의 생애 주기 전반에 걸쳐 균일하지 않으며, 이는 아키텍처적 결과를 초래합니다. 성능 수준은 최첨단(state of the art)으로 처음 출시된 직후 분기별로 66%가 떨어지다가, 2년 후에는 분기별로 32%까지 속도가 느려집니다 (출처: Epoch AI, 2026). 가장 새로운 기능에 기반하여 구축된 것은 감가상각되는 자산(depreciating asset)입니다. 이미 해결된 문제에 기반하여 구축된 것은 매 분기마다 더 저렴해집니다.
두 공급업체가 같은 주에 소형 모델 가격을 인하하다
Anthropic은 2026년 10월 7일, Claude Haiku 5.5를 출시하며, 10만 토큰 미만의 프롬프트 기준으로 Haiku 4.5 대비 90% 낮은 가격을 책정했습니다 (출처: Anthropic, 2026). 입력 비용은 백만 토큰당 $1.00에서 $0.10으로 떨어졌고, 출력 비용은 $5.00에서 $0.50으로 떨어졌습니다 (출처: Anthropic, 2026).
OpenAI도 몇 주 전 같은 방향으로 움직이며, GPT-5.6의 프로모션 요금 대비 GPT-6 Sol과 Luna의 API 가격을 절반으로 낮췄습니다. Luna는 백만 토큰당 입력 $0.10, 출력 $0.50에 도달하여 Haiku 5.5와 동률을 이루었습니다 (출처: OpenAI, 2026).
두 개의 연구소(lab)가 동일한 작업 유형에 대해 같은 가격대에 도달했다는 것은 우연이 아닙니다. 이는 시장이 반복적인 모든 작업의 기본 수준(default tier)을 이제 소형 모델로 규정하고 있다는 것을 의미합니다.
역량도 함께 발전하여 라우팅(routing)이 중요해진 이유
작업을 수행할 수 없는 저렴한 모델은 비용 절감이 아니라 재작업 루프(rework loop)를 만듭니다. 과거에 소형 모델들이 에이전트 기반 작업(agentic work)에서 사용 불가능하게 만들었던 벤치마크 격차는 상당 부분 해소되었습니다. Terminal-Bench 4.0에서 Haiku 5.5는 39.2%를 기록한 반면, Haiku 4.5는 0.0%를 기록했습니다 (출처: Anthropic, 2026).
Haiku 5.5는 또한 호출자(callers)가 호출당 비용 대비 지능을 조절할 수 있는 조정 가능한 노력 설정(adjustable effort setting)을 갖춘 Anthropic의 소형 모델 중 최초입니다 (출처: Anthropic, 2026). 이 설정은 헤드라인 가격보다 더 중요합니다. AutomationBench에서 GPT-6 Sol은 xhigh 노력 설정으로 작업당 $0.27에 33.2%를 기록한 반면, Claude Opus 5는 최대 노력 설정으로 비용의 11.1배를 지불하고도 26.9%를 기록했습니다 (출처: OpenAI, 2026).
프로덕션 팀들이 측정하는 것들
벤더(Vendor) 벤치마크는 가능성(possibility)을 설명합니다. 고객의 배포 사례(Customer deployments)는 경제성(economics)을 설명하며, 이 둘 사이의 간극이 보통 사용자의 아키텍처가 존재하는 곳입니다.
Asana는 짧은 분류 작업(triage work)을 Haiku 5.5로 옮긴 후 작업 완료 시 지연 시간(latency)이 30% 이상 낮아졌다고 보고했습니다 (출처: Anthropic, 2026). AlphaSense는 매주 약 8백만 건의 이러한 호출을 실행하며 문서 질문 워크로드에서 정확도가 0.76에서 0.84로 개선된 것을 측정했습니다 (출처: Anthropic, 2026).
Box는 Haiku 4.5보다 11점 높은 점수를 기록했으며 지연 시간은 절반 수준으로 낮추면서 모델을 대규모 분석 작업(analytical work at scale) 영역으로 이동시켰습니다 (출처: Anthropic, 2026). Cognition은 Opus 5.5 아래에 Haiku 5.5를 보조 에이전트(sidekick subagent)로 배치하고 비용과 지연 시간을 줄이는 동시에 FrontierCode 점수 66.2를 보고했습니다 (출처: Anthropic, 2026).
네 가지 사례 모두에서 나타나는 패턴은 동일합니다. 아무도 비싼 모델을 대체하지 않았습니다. 그들은 단순히 더 적은 작업을 시켰을 뿐입니다.
이것이 실리콘밸리 외부에 가장 중요한 이유
필리핀은 이 문제의 특정 버전을 가지고 있습니다. 기업 중 AI 기술을 사용하는 곳은 14.9%에 불과하며, 필리핀의 AI 시장 규모는 2024년 약 7억 7,200만 달러에서 2030년 34억 9,000만 달러로 성장할 것으로 예상됩니다 (출처: U.S. International Trade Administration, 2026). 수출 수익이 2025년에 약 400억 달러에 달하고 근로자가 190만 명인 IT-BPM 부문에서는 조사된 회원사 중 67%가 이미 AI 도구를 채택했습니다 (출처: U.S. International Trade Administration, 2026).
AI 기술을 사용하지 않는 기업(14.9% 수준)의 경우, 진정한 장애물은 모델 품질이 아닙니다. 오히려 토큰당 가격으로 책정되는 최첨단 스택(frontier-tier stack) 때문에, 누구나 이점을 측정하기 전에 대용량 사용 사례가 경제적이지 않다는 점입니다.
모든 수신 티켓에 대한 요약 통과, 모든 거래에 대한 분류기, 모든 고객 질문에 대한 검색 단계. 이것들이 배포가 비용을 회수할지 결정하는 작업 부하이며, 동시에 단위당 비용이 가장 빠르게 하락하고 있는 바로 그 작업 부하입니다.
공급업체와 무관하게 적용되는 세 가지 라우팅 규칙
첫째, 모델 등급(model tier)보다는 작업 형태(task shape)별로 분리해야 합니다. 분류(Classification), 요약(summarization), 추출(extraction), 압축(compaction)은 대용량이며 좁은 범위의 작업입니다. 계획 수립(Plan) 및 장기 지평 추론(long-horizon reasoning)은 저용량이며 넓은 범위를 다루는 작업입니다. 첫 번째 그룹은 소형 등급에 속하고, 두 번째 그룹은 그렇지 않습니다.
둘째, 캐시를 인프라로 취급해야 합니다. Anthropic은 Sonnet 5.5의 캐시 읽기(cache reads)를 절반으로 줄여 대부분의 에이전트 작업 비용을 약 20% 절감했습니다 (출처: Anthropic, 2026). 캐시 읽기는 에이전트 토큰 소비에서 큰 비중을 차지하므로, 캐싱 격차는 반복적인 청구서 항목이 됩니다.
셋째, 라우팅 규칙을 분기별로 재실행해야 합니다. 고정 성능 비용이 47% 감소했다는 점을 고려할 때, 6개월 전에 조정된 라우팅 테이블은 현재 시점에서는 가격 책정이 잘못되었을 수 있습니다.
심각하게 받아들일 가치가 있는 주의사항
Epoch AI의 저자들은 자신들의 추정치가 벤치마크 데이터에서 나온 것이며, 그 벤치마크 성능이 유용한 작업에 대한 완벽한 대리 지표(imperfect proxy)는 아니라고 언급했습니다 (출처: Epoch AI, 2026). 사용자의 자체 워크로드에서의 가격 하락률은 헤드라인 수치를 따라가지 않을 것입니다. 무언가를 재설계하기 전에 자체 데이터로 완료된 작업당 비용을 측정하십시오.
FAQ
질문: 소형 모델이 프로덕션 고객 업무에 충분히 정확한가요?
답변: 좁고 반복적인 작업의 경우, 현재 고객 배포 사례에서는 이전 소형 모델 대비 손실보다는 정확도 향상이 보고됩니다. 개방형 추론(open-ended reasoning)의 경우에는 여전히 대형 모델이 더 나은 선택입니다 (출처: Anthropic, 2026).
질문: 라우팅을 재조정함으로써 실제로 얼마나 절약할 수 있나요?
답변: Anthropic에 따르면 Haiku 5.5를 실행하는 평균 비용은 Haiku 4.5 대비 약 75% 낮으며, 이전 요청의 90%가 더 저렴한 10만 토큰 미만 구간에 속합니다 (출처: Anthropic, 2026).
질문: 더 큰 모델이 항상 작업당 비용이 더 많이 드나요?
답변: 아닙니다. 동일한 노력(matched effort) 설정에서 중급 모델은 최첨단 모델보다 훨씬 적은 작업당 비용으로 성능을 능가할 수 있으며, 이는 AutomationBench 결과가 보여주는 바입니다 (출처: OpenAI, 2026).
질문: 새로운 모델이 출시될 때마다 모델을 바꿔야 하나요?
답변: 가격 하락세는 기능이 처음 등장한 직후 가장 빠르다가 이후 약 2년 동안 완만해집니다. 자체 워크로드로 평가하고, 수치가 유지된다면 그대로 사용하는 것이 좋습니다.
핵심 요약 (Key Takeaway)
AI 스택에서 가장 비용이 많이 드는 결정은 더 이상 어떤 모델이 어려운 질문에 답하는가입니다. 그것은 어려운 질문당 100개의 쉬운 작업을 처리하는 모델이 무엇인가 하는 것입니다. 대부분의 조직에게 있어, 그 라우팅(routing) 결정 지점에서 다음 규모(next order of magnitude)의 비용 절감이 존재합니다.
이번 달에 하나의 워크로드를 가져와서 완료된 작업당 비용을 측정하고, 해당 작업을 처리하는 모델이 애초에 최첨단 기능(frontier capability)을 필요로 하는지 질문해 보십시오.
출처 (Sources)
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기