강력한 모델 이후 고빈도 에이전트 단계를 축소하는 방법
요약
본 기사는 에이전트 시스템의 비용 효율성을 높이는 방법을 다룹니다. 모든 요청에 강력한 모델을 사용하는 대신, 각 단계별로 필요한 최소 사양의 저렴하고 작은 모델을 활용하여 전체 추론 비용을 크게 절감할 수 있습니다. Intercom 사례를 통해 쿼리 정규화 같은 특정 작업을 GPT-4에서 Qwen과 같은 소형 모델로 대체하여 월 25만 달러에 달하는 지출을 줄인 방법을 제시합니다.
핵심 포인트
- 모든 단계에 최고 성능 모델을 사용할 필요는 없습니다.
- 작고 저렴한 모델로도 충분한 '좁은(narrow)' 작업이 많습니다.
- 쿼리 정규화 같은 특정 작업을 분리하여 비용 절감 효과를 극대화할 수 있습니다.
- 최종 사용자 경험 유지를 위해 가장 어려운 프롬프트만 최첨단 모델에 남겨야 합니다.
모든 요청마다 실행되며 해당 단계가 필요로 하는 모델보다 더 강력한 모델에서 구동되는 좁은(narrow) 단계들은 저렴한 모델의 후보가 될 수 있습니다. 측정된 지출액을 통해 절감할 부분이 어디에 있는지 알 수 있습니다. 가장 강력한 모델에서 단계를 증명하고, 그 작업을 더 작거나 파인튜닝된 모델로 옮긴 다음, 제품 지표는 기존과 동일하게 유지합니다. Fergal Reid는 Intercom의 쿼리 정규화(query canonicalization)가 GPT-4.1 기준으로 월 25만 달러에 달했을 수 있으며, 사후 학습된(post-trained) 140억 개 매개변수(parameter)의 Qwen 모델이 해당 작업만으로도 수십만 달러에 달하는 추론 비용을 거의 절감했다고 말했습니다.
Fergal Reid는 Intercom의 최고 AI 책임자(Chief AI Officer)이며, 2026년 2월에 Chain of Thought에 대해 발표했습니다. Loïc Houssier는 Superhuman Mail의 CTO이며, 2026년 5월에 발표했습니다. Loïc는 최고의 모델에서 시작하여 기능이 작동할 때만 비용을 절감합니다. Fergal의 정규화 단계는 이미 GPT-4.1에서 실행되었고, 그 다음으로 사후 학습된 140억 개 매개변수 모델을 사용했습니다.
어떤 에이전트 단계가 최첨단(frontier) 모델을 떠날 수 있는지 어떻게 선택하나요?
안정적인 작업 부하(job), 높은 호출량, 그리고 자유 형식의 답변을 재판단할 필요 없이 점수를 매길 수 있는 출력을 가진 단계를 고르세요. Fergal은 Intercom의 고객 서비스 에이전트인 Fin을 10~15개의 머신러닝 문제 클러스터로 설명했습니다. 최종 사용자에게 답변하는 가장 어려운 프롬프트는 여전히 최첨단 Claude Sonnet 모델에 남아 있었습니다. 부가적인(ancillary) 프롬프트들은 달랐습니다. 그것들은 원하는 최종 사용자 경험을 여전히 제공하면서도 가장 작고, 저렴하며, 지연 시간이 짧은 모델에서 실행되었습니다.
그가 가격을 책정한 작업이 바로 쿼리 정규화였습니다. 검색(retrieval) 이전에 LLM은 질문을 요약하고 이를 표준 형식(canonical form)으로 다시 작성합니다. 최종 사용자는 사람마다 다르고 부정확할 수 있는 구어체로 질문합니다. 검색 모델은 최신 LLM보다 성능이 낮기 때문에, 재작성 작업은 검색을 개선했고, 그를 통해 나중 답변도 개선되었습니다. 이 작업에는 GPT-4나 Claude Opus가 필요하지 않았습니다. GPT-4.1이 처리했으며, 지출액은 상당했습니다.
정확히 기억나지는 않지만, 단지 요약 작업만으로도 월 25만 달러에 달했을 수 있습니다.
Fergal Reid는 Intercom의 최고 AI 책임자(Chief AI Officer)로서 Chain of Thought 에피소드 49에서,
How Intercom Cut $250K/Month b… - Chain of Thought | AI Agents, Infrastructure & Engineering - Apple Podcasts
팟캐스트 에피소드 · Chain of Thought | AI Agents, Infrastructure & Engineering · 2월 26일 · 54분
![]()
요약 작업에 맞춰 사후 학습된 (post-trained) 140억 개 매개변수(parameter)의 Qwen 모델이 GPT-4.1 호출을 대체했습니다. 이 교체는 추론 비용(inference)에서 수십만 달러 중 거의 모든 금액을 절감했으며, 단계에 대한 더 정밀한 제어권을 제공했습니다. 사후 학습 전에, 팀은 잘 프롬프트된(well-prompted) 그러나 훈련되지 않은 모델로 실제 테스트를 진행하여 해당 작업에 근접했는지 확인합니다.
따라서 사용 사례에 따라, 그리고 보통 비싼 것부터 시작하며, 가장 좋은 것을 선택합니다. 그리고 그 기능이 성공적이라면, 어떻게 최적화할 수 있을까요? 비용을 어떻게 낮출 수 있을까요?
_Loïc Houssier는 Superhuman Mail의 최고 기술 책임자(CTO)로서 Chain of Thought 에피소드 59에서,
더 저렴한 모델이 단계를 수행할 때 어떻게 품질을 유지하나요?
더 적게 함으로써(doing less) 저렴한 모델이 높일 수 없는 결과를 유지하는 것입니다. Fergal의 확인 과정은 두 가지 신호에 대한 실제 A/B 테스트입니다. 소프트 해소(soft resolution)는 Fin이 정답으로 간주하여 답변을 제공하고, 인간에게 전달되며, 사용자가 답장 없이 떠나는 경우입니다. 하드 해소(hard resolution)는 사용자가 감사하다거나 예와 같이 질문이 해결되었음을 확인하는 경우입니다. 답변을 줄 때마다, 하드 해소는 약 3040%의 비율로 발생하며, 이 비율은 소프트 해소율의 약 3040% 정도가 됩니다. 하드 해소가 북극성(North Star)이자 진실 값(ground truth)입니다.
그리고 소프트 해상도가 올라갔는지 확인하고, 하드 해상도는 떨어지지 않는지 기본적으로 확인합니다.
— Fergal Reid, Intercom 최고 AI 책임자 (Chief AI Officer), Chain of Thought ep 49_
소프트 해상도와 하드 해상도의 비율은 모델이 변경될 때마다 대략 일정하게 유지되어야, 제품이 단순히 회피 기계(deflection machine)가 되는 것을 막을 수 있습니다. GPT에서 Claude Sonnet으로 전환하는 것은 수백만 건의 최종 사용자 상호작용 A/B 테스트였습니다. Fin은 매주 백만 건 이상의 대화를 성공적으로 해결하고 있었고, 아마도 그보다 훨씬 많았는데, 이것이 이러한 테스트를 민감하게 만듭니다. 그들은 해상도의 0.1% 지점까지 신경 쓰며, 모든 백테스트는 실제 운영(production) 결과와 다르게 나타날 수 있습니다.
해상도는 출시 당시 약 30%였고 70%를 향하고 있었습니다. 이러한 개선의 대다수는 핵심 프론티어 모델이 아닌 주변 시스템, 즉 검색 모델과 거의 처음부터 구축된 맞춤형 재순위 지정기(re-ranker)에서 나왔습니다. 보조 단계가 여전히 비용이 많이 드는 부분이 될 수 있으며, 측정 기준의 실제 부분입니다. 고객이 보고한 환각(hallucinations)을 포함하여 운영 사례로 해당 단계를 백테스트하고, 절감액을 보기 전에 통과 기준점(pass bar)을 설정하십시오.
이 두 가지 계층 구조가 없는 제품에서는 동일한 규칙 형태를 사용합니다. 사용자에게 보이는 결과는 평평하게 유지되거나 강력 모델 버전 대비 개선되어야 합니다. 모델이 더 많이 포기하거나, 더 많이 이관하는 이유로 움직이는 대리 지표(proxy)는 통과하지 못합니다.
월별 지출에 따라 단계를 어떻게 순위화하나요?
월별 지출을 단계별로 정렬하고, 해당 작업이 좁고 비용이 높은 경우에만 행에 표시하십시오. 희귀한 프론티어 호출(frontier call)은 요청당 가격이 비싸 보여도 여전히 줄여서는 안 되는 잘못된 것일 수 있습니다. 모든 티켓이나 모든 이메일에서 실행되는 단계를 순위화하십시오.
— 가상의 총액을 사용한 예시 스케치. 운영 보고서가 아니며, 어느 팀의 구현물도 아닙니다.
steps = [
{"step": "canonicalize_query", "model": "large_general", "spend_usd": 4800, "narrow": True},
{"step": "answer_user", "model": "frontier", "spend_usd": 3100, "narrow": False},
...
]
narrow는 트레이스(traces)를 읽은 후 사용자가 판단하여 설정하는 값입니다. 제공업체(provider)가 반환하지는 않습니다. 만약 한 단계가 재시도되면, 모든 시도를 해당 단계의 월별 총액에 추가해야 합니다. 그렇지 않으면 순위(ranking)에서 실패 기록이 숨겨집니다. 그런 다음 가장 많이 표시된(flagged) 상위 단계 몇 개의 전체 트레이스를 읽어보세요. 이 두 팀이 이동시킨 단계들은 그들이 채점할 수 있는 결과물, 즉 정규화된 쿼리(canonical query)나 이미 확정된 세트의 레이블을 가진 반복 작업이었습니다. 개방형 답변은 여전히 frontier 모델에 남아 있었습니다.
FAQ
어떤 Intercom 단계가 GPT-4.1에서 빠졌나요?
쿼리 정규화(Query canonicalization)입니다. 이는 검색 전에 최종 사용자의 질문을 다시 작성하는 요약 작업입니다. 사후 훈련된 140억 개 매개변수(parameter)의 Qwen 모델이 해당 작업에서 GPT-4.1을 대체했습니다. Claude Sonnet은 가장 어려운 프롬프트에 남아 있었습니다.
Superhuman은 어떤 것을 강력한 모델에서 제거했나요?
자동 레이블 분류(Auto-label classification)입니다. 강력한 모델이 모든 이메일에 적용되었고, 팀이 유용한 세트가 10개 또는 12개의 레이블임을 알게 되었습니다. 그 레이블들은 저렴하고 전용 인프라에서 가볍게 미세 조정된 오픈(open) 모델을 위한 BERT 분류기 유형의 작업이 되었습니다. 에이전틱 경로(agentic path)는 최신 Opus에 남아 있었습니다.
교체 후 무엇은 꾸준히 유지되어야 하나요?
Fin의 경우, 어려운 해결책(hard resolutions)은 낮아져서는 안 되며, 소프트-투-하드 비율(soft-to-hard ratio)은 대략 일정하게 유지되어야 합니다. 다른 제품의 경우에는, 강력한 모델 버전과 비교하여 동일한 사용자 가시적 결과물(user-visible outcome)을 프로덕션 비교에서 유지해야 합니다. 더 낮은 비용에 더 나쁜 결과가 나온 변경 사항은 실패합니다.
요약
모델을 교체할 모델을 선택하기 전에, 모든 시도를 포함하여 월별 지출에 따라 단계의 순위를 매기세요.
가장 강력한 모델에서 해당 기능을 증명하여 작업 자체가 실질적인지 확인하세요.
정규화(canonicalization)나 고정된 레이블 세트와 같이 범위가 좁고 트래픽이 많은 단계를 옮기세요.
사후 학습(post-training)에 투자하기 전에 잘 프롬프트 된 소형 모델을 실제 작업에 돌려보세요.
운영 결과가 유지될 때만 더 저렴한 모델을 출시하세요. Fin의 경우, 하드 해상도는 떨어지지 않습니다。
에피소드 클립이 포함된 더 긴 설명은 Chain of Thought에서 확인할 수 있습니다. 이 글은 이 에피소드를 참고했습니다.
에피소드 스크립트를 기반으로 AI의 도움을 받아 작성됨.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기