토큰값은 역대 최저인데 AI 비용은 오히려 늘어나는 이유
요약
LLM 토큰 단가는 중국 오픈소스 모델 등의 공세로 역대 최저 수준까지 하락했습니다. 하지만 고성능 AI 에이전트가 복잡한 문제를 해결하거나 반복적인 검증을 수행하면서 실제 사용되는 토큰 양 자체가 급격히 증가하고 있습니다. 따라서 단순히 토큰당 가격만 볼 것이 아니라, 하나의 작업을 완료하는 데 드는 총 비용(Cost per Task)으로 접근해야 합니다.
핵심 포인트
- 토큰 단가는 하락했지만, AI 에이전트의 복잡한 작업 수행으로 인해 실제 지출액은 증가하고 있습니다.
- 고성능 모델 사용 시 더 많은 추론 과정과 반복 검증이 필요해 토큰 소모량이 늘어납니다.
- 비용 효율성을 판단할 때는 '토큰당 가격'보다 '작업 하나에 드는 총 비용(Cost per Task)'을 기준으로 삼아야 합니다.
토큰값은 역대 최저인데 AI 비용은 오히려 늘어나는 이유
-
AI 모델을 쓸 때 내는 토큰 가격이 사상 최저 수준까지 내려옴
-
실리콘데이터의 LLM 토큰 지출 지수는 지난달 말 100만 토큰당 97센트로 떨어져 지수 발표 이후 최저치를 찍음
-
올여름 고점과 비교하면 절반도 안 되는 가격임
-
이 지수는 모델별 사용량과 입력 출력 비중까지 반영한 실제 시장 평균 가격임
-
가격을 끌어내린 건 키미 같은 중국 오픈소스 모델의 저가 공세임
-
중국 모델이 싸게 치고 들어오자 글로벌 기업들도 줄줄이 값을 내림
-
오픈AI는 7월 GPT-5.6 테라와 루나 API 가격을 각각 20%와 80% 낮췄고 8월엔 솔도 20% 인하함
-
구글은 지난달 제미나이 3.7 플래시를 이전 모델의 절반 가격인 100만 토큰당 입력 0.75달러 출력 3.75달러에 내놓음
-
중국 모델과 프런티어 모델의 성능 차이가 좁혀지면서 가격 경쟁은 더 치열해짐
-
그런데 토큰이 싸졌다고 AI 쓰는 돈이 줄어드는 건 아님
-
요즘 고성능 모델은 어려운 문제를 풀려고 더 길게 생각하고 AI 에이전트는 일 하나 하면서 모델을 수없이 불러 검증을 반복함
-
단가가 내려가도 쓰는 양이 훨씬 많아지면 청구서는 오히려 커질 수 있음
-
앤트로픽의 클로드 페이블 5.1이 대표 사례임
-
입력과 출력 가격은 100만 토큰당 10달러와 50달러로 그대로 두고 캐시 읽기 가격만 1달러에서 0.25달러로 75% 내림
-
하지만 AAII 최대 노력 기준 작업당 비용은 3.69달러로 이전 모델 페이블 5의 3.14달러보다 18% 비쌈
-
성능을 끌어올리느라 출력 토큰을 약 1.7배 더 쓴 탓임
-
시장 전체로 봐도 사정은 비슷함
-
구글의 월간 토큰 처리량은 지난 5월 3200조개로 1년 새 7배 늘어남
-
포춘에 따르면 토큰 가격은 2023년 이후 90% 넘게 떨어졌지만 LLM 전체 지출은 작년 말 이후 두 배 가까이 불어남
-
모델마다 토큰을 먹는 양도 제각각임
-
이코노미스트가 인용한 조지아공대 연구에선 같은 작업에 딥시크 모델 하나가 오픈AI 경쟁 모델보다 약 23배 많은 토큰을 씀
-
그래서 비용 경쟁력은 토큰당 가격보다 작업 하나 끝내는 데 드는 돈으로 따져야 한다는 목소리가 커지고 있음
-
아폴로 수석 이코노미스트 토르스텐 슬록은 이 현상을 제본스의 역설에 빗댐
-
기업들은 토큰이 싸질수록 돈을 아끼기보다 에이전트를 더 돌리고 자동화와 코드 생성을 늘림
-
토큰 단가가 아무리 떨어져도 전체 AI 지출은 되레 불어날 수 있음
-
한 줄 평: 토큰값은 역대 최저지만 더 오래 생각하고 더 자주 호출하는 AI 때문에 실제 비용은 늘고 있어 이제는 토큰당 가격보다 작업 하나에 드는 비용을 봐야 함
AI 자동 생성 콘텐츠
본 콘텐츠는 X AI 연구의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기