저렴한 모델들이 AI 라우팅(Routing)을 인프라로 변화시키고 있다
요약
저렴한 오픈 웨이트 모델의 부상으로 인해 개발자들이 단일 모델 대신 작업 성격에 따라 모델을 분리하여 사용하는 'AI 라우팅' 방식이 인프라의 핵심으로 자리 잡고 있습니다. 비용 효율적인 모델로 단순 작업을 처리하고, 고성능 모델은 결정적인 단계에 배치하는 시스템 설계가 중요해지고 있습니다.
핵심 포인트
- 모델을 OS가 아닌 인프라처럼 라우팅하는 추세
- DeepSeek 등 저렴한 모델이 중간 규모 작업 점유율 확대
- 에이전트 워크플로에서 비용 최적화를 위한 단계별 모델 분리
- 성능과 비용의 균형을 맞춘 합리적인 시스템 설계의 중요성
AP는 7월 26일, 중국의 AI 모델들이 더 저렴하고, 점점 더 유능해지며, 늘어나는 실제 업무 영역에 충분히 적합하기 때문에 미국 사용자들을 확보하고 있다고 보도했습니다. 국가 간의 경쟁 구도는 더 자극적인 헤드라인을 만들어내겠지만, 라우팅(Routing) 행태의 변화는 더 유용합니다.
개발자들은 더 이상 하나의 모델을 선택하여 운영체제(OS)처럼 취급하지 않습니다. 그들은 작업을 인프라(Infrastructure)처럼 라우팅(Routing)하기 시작했습니다.
Mozilla의 CTO인 Raffi Krikorian은 AP와의 인터뷰에서, Moonshot의 Kimi K3가 출시된 지 며칠 만에 더 빠릿하게 느껴져 일부 일상적인 업무를 해당 모델로 전환했다고 밝혔습니다. 그는 이미 일정, 문서, 이메일 관련 일상 업무에 Z.ai의 GLM-5.2를 사용해 왔습니다. 미국의 기술 경영진인 Curt Meinhold는 대부분의 작업에 Anthropic의 최상위 모델이 필요하지 않기 때문에, 잠재 고객 발굴(Lead generation) 및 영업 워크플로(Workflow)에 DeepSeek를 점점 더 많이 사용하고 있다고 말했습니다.
이는 모델 게이트웨이(Model gateways)에 나타나는 수치와도 일치합니다. Vercel의 6월 AI 게이트웨이(AI Gateway) 데이터에 따르면, 오픈 웨이트(Open-weight) 모델이 게이트웨이 토큰의 29%를 처리했는데, 이는 4월의 11%에서 증가한 수치인 반면, 지출액에서는 4% 미만을 차지했습니다. DeepSeek는 토큰 볼륨의 22.6%에 도달했습니다. Anthropic은 여전히 32%의 토큰에서 61%의 지출을 점유하고 있으며, 이는 특히 리스크가 큰 작업(Higher-stakes work)에서 나타납니다.
이러한 분리가 핵심입니다. 저렴한 모델들이 모든 곳에서 프런티어 모델(Frontier models)을 대체하고 있는 것은 아닙니다. 그들은 지루하고 볼륨이 큰 중간 영역을 잠식하고 있습니다.
에이전트(Agents)에게 있어 이는 벤치마크 리더보드(Benchmark leaderboard)의 드라마틱한 변화보다 더 중요합니다. 에이전트적 워크플로(Agentic workflow)는 단 하나의 프롬프트(Prompt)로 이루어지지 않습니다. 그것은 계획(Planning), 검색(Retrieval), 도구 호출(Tool calls), 재시도(Retries), 요약(Summarization), 검증(Validation), 그리고 정리(Cleanup)의 과정입니다. 출력 토큰 100만 개당 수십 달러가 드는 것과 비교해 단 몇 센트가 드는 것은, 당신이 무엇을 자동화할 의지가 있는지를 변화시킵니다.
만약 저렴한 모델이 그저 괜찮은 수준이라면, 그 모델에게 첫 번째 단계(First pass), 지루한 단계(Boring pass), 또는 좁은 범위의 단계(Narrow pass)를 맡길 수 있습니다. 비싼 모델은 결정적인 지점(Decision point)을 위해 남겨두십시오. 그것은 성능 저하(Downgrade)가 아닙니다. 그것은 그저 합리적인 시스템 설계(Systems design)입니다.
이것이 바로 "최고의 모델"이라는 논쟁이 점점 쓸모없어지는 이유이기도 합니다. 무엇을 위한 최고입니까? 일회성 추출 스크립트(extraction script)를 작성하는 것은 마이그레이션 계획(migration plan)을 검토하는 것과 같지 않습니다. 200개의 로그를 요약하는 것은 운영 환경(production)을 건드릴지 여부를 결정하는 것과 같지 않습니다. 성능은 10% 떨어지지만 비용은 20배 더 저렴한 모델이 파이프라인(pipeline)의 처음 세 단계에서는 더 나은 작업자가 될 수 있습니다.
미국 연구소(labs)들에게 불편한 점은 이제 가격 압박이 하나의 제품 기능(product feature)이 되었다는 사실입니다. 만약 중국의 오픈 웨이트(open-weight) 모델이 일상적인 코드 작성, 연구, 추출 또는 백오피스 에이전트(back-office agent) 작업에 충분히 훌륭하다면, 팀들이 최종 결정을 위해 미국의 프론티어(frontier) 모델을 유지하더라도 해당 모델은 기본 스택(default stack)의 일부가 됩니다. 프리미엄 모델은 여전히 돈을 벌지만, 더 저렴한 모델은 습관을 점유합니다.
실제적인 주의 사항도 있습니다. Vercel과 OpenRouter가 시장 전체는 아닙니다. 어떤 워크로드(workloads)는 컴플라이언스(compliance), 데이터 거주성(data residency) 또는 정치적 리스크를 수반합니다. 어떤 오픈 웨이트(open-weight) 모델은 전체 크기로 셀프 호스팅(self-host)하기에 실용적이지 않습니다. Kimi K3가 오픈 웨이트(open-weight)일지라도, 2.8T 규모의 모델이 노트북에서 돌릴 수 있는 장난감이라는 뜻은 아닙니다. 이것이 그저 "Claude를 다운로드해서 교체하기만 하면 된다"고 주장하는 사람은 현실보다 더 깔끔한 이야기만을 팔고 있는 것입니다.
그럼에도 불구하고, 방향성은 놓치기 어렵습니다. 모델 계층(model layer)이 라우팅 계층(routing layer)으로 변하고 있습니다.
저는 이것이 건강한 현상이라고 생각합니다. 이는 개발자들이 모델 숭배에서 벗어나 실제 결과물(receipts)에 집중하게 만듭니다. 작업 성공률을 측정하십시오. 재시도(retries)를 추적하십시오. 판단이 중요한 곳에는 비싼 모델을 유지하십시오. 볼륨(volume)이 중요한 곳에는 더 저렴한 모델을 사용하십시오. 수치가 변하면 교체하십시오.
이것은 지루한 인프라(infrastructure) 작업입니다. 그리고 보통 진짜 변화는 바로 그곳에 숨어 있습니다.
원문 게시처: https://komoai.live/cheap-models-ai-routing-infrastructure
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기