
AI 경제의 지속되는 역설 — 모델은 더 좋아지고 효율적이 되지만, 비용은 여전히 통제 불능으로 치솟을 수 있다
요약
AI 모델의 성능 향상에도 불구하고, 에이전트 워크로드의 '토큰 증폭' 현상으로 인해 운영 비용이 급증하는 역설적 상황을 분석합니다. 복잡한 다단계 작업 시 누적되는 토큰 소비가 재무적 부담으로 이어질 수 있음을 경고합니다.
핵심 포인트
- 에이전트 워크로드는 단일 요청에도 수백만 개의 토큰을 소비할 수 있음
- 토큰 증폭(Token amplification)으로 인해 대화가 길어질수록 비용과 지연 시간 증가
- 다단계 프로세스(웹 검색, 데이터 조회 등) 수행 시 누적 토큰 사용량 급증
- 효율적인 모델 선택과 데이터 구조화가 비용 통제의 핵심
AI 분야의 의문스러운 경제성에 대해 많은 글이 작성되어 왔지만, 대부분의 논의는 시장 점유율, 데이터 센터 (datacenter) 투자, 전력 소비와 같은 상위 수준의 개념을 중심으로 이루어집니다. 기술에 대한 일반적인 기대는 기술이 발전함에 따라 더 저렴해진다는 것이지만, AI 분야에는 다소 특이한 문제가 있습니다. VentureBeat의 기사에서 자세히 설명된 바와 같이, 모델이 개선됨에도 불구하고 사용 비용은 실제로 급등하고 있습니다.
지난 2년 동안 모델의 모든 발전 덕분에, 단순하거나 중간 정도의 난이도의 질문에 답하는 봇을 보유하는 것은 이제 당연한 일이 되었습니다. 모든 봇이 합리적인 정확도로 이를 수행하기 때문입니다. 진짜 잠재력은 에이전트 워크로드 (Agentic workloads)에 있으며, 이는 이전에는 사람이 수행하는 데 며칠, 심지어 몇 주가 걸렸을 다단계의 반복적인 작업에 봇을 투입할 수 있게 해줍니다. 봇에게 귀하의 결제 시스템, 몇 개의 Excel 스프레드시트, 그리고 CRM에 대한 접근 권한을 부여하고 "카테고리별로 수익성이 높은 고객은 누구이며 그들의 트렌드는 무엇인가?"와 같은 질문을 던지는 것은 식은 죽 먹기처럼 쉬워집니다.
귀하가 그 질문을 던지고 몇 분 안에 상당히 정확한 답변을 받는 것은 사소해 보일 수 있지만, 막후에서는 귀하가 예상하는 것보다 훨씬 더 많은 양의 프로세싱이 진행되고 있습니다. AI 컴퓨팅 시간은 토큰 (tokens) 단위로 측정됩니다. 짧은 질문과 답변은 약 200에서 2,000 토큰 사이일 수 있으며, 모델이 인터넷 조사를 수행해야 하는 질문은 약 1,000에서 4,000 토큰 정도일 수 있습니다. 그러나 에이전트 작업은 겉보기에 무해해 보이는 요청 하나에 쉽게 수백만 개의 토큰을 소비할 수 있습니다. 어떻게 그럴 수 있을까요? 최근 만들어진 용어인 토큰 증폭 (Token amplification) 때문입니다.
간단히 설명하자면, 모델은 메모리나 인지 능력이 없기 때문에 대화 중에 새로운 질문을 할 때마다 대화 전체—사용자가 작성한 모든 내용, 봇이 답변한 모든 내용, 그리고 업로드한 모든 파일—를 다시 불러오고 처리해야 합니다. 이는 긴 대화에서 추가되는 질문들이 점진적으로 더 많은 비용을 발생시킨다는 것을 의미합니다. 대화 중 각 질문 자체에는 500개의 토큰만 필요할 수 있지만, 이전의 모든 정보를 다시 처리하는 과정이 누적되면서 두 번째 질문은 600개를 소모할 수 있고, 이런 식으로 계속 늘어납니다. 대화 전체는 개별 상호작용의 누적된 토큰 수를 사용하며, 추가적인 페널티로 대화가 길어질수록 응답 속도(Response speed) 또한 느려지는 경향이 있습니다.
앞서 언급한 보고서 생성 작업은 여러 단계로 나누어 실행되어야 합니다. 예를 들어 Excel 시트를 조회하는 데 3단계, CRM을 위해 4단계, 제품에 대한 문맥적 정보를 얻기 위한 6회 정도의 웹 검색, 그리고 12개 정도의 중간 처리 및 계산 단계가 필요할 수 있습니다. 각 단계는 잠재적으로 수천 개의 토큰을 추가하며, 작업이 끝날 때쯤이면 모든 단계를 합쳐 누적으로 수백만 개의 토큰이 소비될 수 있습니다.
따라서 비용은 매우 빠르게 통제 불능 상태로 치솟을 수 있습니다. 이는 모든 데이터가 해석하기 쉽고, 모델이 재시도(Retries)를 할 필요가 없으며, Claude Opus와 같은 모델 대신 적당히 강력한 모델을 사용한다는 최선의 시나리오를 가정했을 때의 이야기입니다.
재무적인 관점에서 보면, 이는 현재 가격 기준 대략적인 추정치로 평범한 질문 하나가 280,000개의 토큰을 소모하여 1달러의 비용을 발생시킬 수 있음을 의미합니다. 별것 아닌 것처럼 들릴 수도 있지만, 이는 _단 하나의 작업_일 뿐입니다. 만약 대시보드를 위해 이 작업을 15분마다 실행하도록 예약해 두었다면, 갑자기 이 비용은 하루에 96달러, 즉 한 달에 2,880달러가 됩니다. 그리고 방금 든 작업 예시는 상당히 간단한 편이었습니다. 까다로운 다단계 보고서의 경우 수백만 개의 토큰이 필요할 수 있으며, 이 경우 1달러였던 비용이 10달러로 늘어나, 기업의 한 부서에서 제한된 수의 사용자만을 위해 단 하나의 보고서를 만드는 데 총 28,800달러가 들 수도 있습니다.
이것이 바로 Anthropic, Microsoft, OpenAI 및 거의 모든 다른 플레이어들이 지난 4월에 주요 서비스들을 사용량 기반 과금 (usage-based billing) 방식으로 전환하고, 고정 요금제 (fixed-rate plans)에서의 토큰 사용량을 엄격히 제한한 핵심적인 이유입니다. 이로 인해 많은 가격 충격 사건 (sticker shock events)이 발생했으며, 전 세계 개발자들은 자신들의 바이브 코딩 (vibe coding)이 실제로 얼마나 많은 비용을 발생시키는지 깨닫고 망연자실했습니다.
수많은 AI 에이전트 (AI agents)를 사용하는 대기업의 경우, 이러한 비용은 감당하기 어려울 정도로 커질 수 있으며 종종 일반적인 인간 직원보다 더 많은 비용이 들 수도 있습니다. Uber, Microsoft, Amazon, Walmart를 포함한 많은 기업은 AI 지출을 억제하는 방식으로 대응해 왔습니다. 비용 통제가 최우선 과제가 됨에 따라, 토큰 지출은 재무 부서와 엔지니어링 부서 모두에게 갑작스러운 문제가 되었습니다. VentureBeat가 간결하게 표현했듯이, 에이전트 중심 기업들에게 "프롬프트 재설계 (prompt redesign)는 마진 (margin)에 영향을 주는 사건"이며, 더 생생하게 표현하자면 "제대로 제한되지 않은 에이전트 루프 (agent loop)는 신용카드가 연결된 서비스 중단 (outage)과 같다"라고 할 수 있습니다.
대부분의 AI 업체들이 여전히 고정 월간 요금제를 제공하고 있지만, 이는 종종 가혹한 토큰 제한을 동반합니다. 그러나 대부분의 고정 가격 서비스가 그러하듯, 가장 유능한 봇 조종사 (bot-wranglers)들은 필연적으로 가장 많은 토큰을 소모하게 될 것입니다. 이는 단순히 사용량 자체가 많기 때문만이 아니라, 그들이 수행할 작업의 유형이 토큰 증폭 (token amplification)의 영향을 가장 크게 받는 작업들이기 때문입니다.
이는 일반 사용자들이 소수의 전문가 비용을 쉽게 상쇄할 것이라는 기존의 재무 모델에 차질을 빚게 합니다. 전문가들의 사용량은 월간 이익의 상당 부분을 갉아먹거나, 아예 모두 소진해 버릴 수 있습니다.
AI 기업들은 가만히 앉아 있지 않으며, 현재로서는 토큰당 비용 (per-token cost)을 낮추는 것이 대부분의 엔지니어링 팀에게 주요 과제가 될 가능성이 높습니다. 프롬프트 캐싱 (Prompt caching), 모델 라우팅 (model routing), 배치 처리 (batch processing), 시맨틱 캐싱 (semantic caching), 그리고 컨텍스트 윈도우 관리 (context window management) 등은 토큰 지출을 대폭 줄일 수 있는 많은 기술적 조치 중 일부이며, 각각은 두 자릿수 퍼센트의 비용 절감 효과를 가져다줍니다.
그럼에도 불구하고 비용이 계속 치솟는 이유는 단순합니다. 모델이 더 똑똑해지고 사람들이 모델을 사용하는 데 더 능숙해질수록, 에이전트 기반 작업 (agentic tasks)은 더욱 복잡하고 길게 실행될 것이며, 이는 토큰 수에 여러 자릿수(multiple orders of magnitude)의 증가를 더하기 때문입니다.
Deepseek V4 Pro와 V4 Flash가 최근의 진보를 보여주며 서구권의 유사한 모델들을 압도적으로 저렴한 가격으로 공략하고 있음에도 불구하고 (보도에 따르면 전자는 최대 17배, 후자는 25배 저렴함), 당분간은 패배하는 경주처럼 보입니다. 주요 서구권 기업 중에서는 Anthropic만이 첫 분기 흑자를 예측했으나, 다른 기업들과 마찬가지로 누적 지출 측면에서는 여전히 수십억 달러의 적자 상태에 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Tom's Hardware의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기