
AI 기술 구축 vs 구매: 전문 서비스 분야를 위한 SLM vs LLM 가이드 (2026)
요약
전문 서비스 기업을 위한 SLM 구축과 LLM 구매 사이의 전략적 가이드를 제공합니다. 단순히 모델을 선택하는 문제를 넘어, 모델과 비즈니스 시스템을 연결하는 '조정 계층(coordination layer)' 설계의 중요성을 강조합니다.
핵심 포인트
- 단순 모델 선택보다 모델과 업무 시스템 간의 간극을 메우는 것이 핵심
- AI 조정 간극(AI Coordination Gap)을 해결하기 위한 조정 계층 설계 필요
- 맞춤형 SLM과 기성 LLM 중 수익성을 결정하는 손익분기점 계산법 제시
- Azure Logic Apps, CRM 등 기존 워크플로와의 통합이 필수적
Originally published at twarx.com - read the full interactive version there.
최종 업데이트: 2026년 7월 28일
전문 서비스 분야의 **AI 기술 (AI technology)**에 대한 2026년 구축(build) 대 구매(buy) 논쟁은 모델의 문제, 즉 맞춤형 소형 언어 모델 (SLM, Small Language Model) 대 기성 대형 언어 모델 (LLM, Large Language Model)의 문제로 프레임이 짜여지고 있지만, 이러한 프레임은 조용히 기업들을 파산시키고 있습니다. 대부분의 AI 워크플로 (AI workflows)는 완전히 잘못된 문제를 해결하고 있습니다. 귀하의 AI 기술 스택에 대한 올바른 질문은 어떤 모델을 라이선스할 것인가가 아니라, 모델이 답변을 생성하는 지점과 시스템이 실제로 업무를 수행하는 지점 사이의 간극을 메울 수 있는가입니다.
이는 Azure Logic Apps, CRM, 빌링 엔진(billing engine), 그리고 인간 승인자를 거치면서도 실수 없이 출력을 라우팅하는 것을 의미합니다. 그 간극이 바로 예산이 낭비되는 지점입니다.
이 글을 마칠 때쯤이면 귀하는 언제 맞춤형 SLM을 구축할지, 언제 LLM을 구매할지, 그리고 이 중 어느 것이 실제로 수익을 낼지를 결정하는 조정 계층 (coordination layer)을 어떻게 설계할지에 대한 구체적인 프레임워크를 갖게 될 것입니다. 여기에는 제가 현재 모든 고객 상담 전에 실행하는 정확한 손익분기점 토큰 계산법 (break-even token math)도 포함됩니다.
구축 대 구매 결정은 모델의 순수한 품질에 관한 것이 아니라, 모델을 실제 비즈니스 시스템에 연결하는 조정 계층 (coordination layer)에 관한 것입니다. 이것이 AI 조정 간극 (AI Coordination Gap)의 핵심입니다.
개요: 왜 맞춤형 SLM 대 기성 LLM 질문이 함정인가
대행사 운영자나 이커머스 운영자에게 2026년의 AI 전략이 무엇인지 물어본다면, 대개 모델 이름을 듣게 될 것입니다. OpenAI의 GPT-4급 시스템, Anthropic의 Claude, 또는 자체 인프라에서 실행되는 미세 조정된 (fine-tuned) 오픈 웨이트 (open-weight) 소형 언어 모델 (small language model) 같은 것들 말입니다. 대화는 모델 단계에서 멈춥니다. 그것이 바로 실수입니다.
전문 서비스 기업들에게 있어 불편한 진실은 다음과 같습니다. 모든 전략 회의에서 모델이 가장 많은 시간을 차지하지만, 프로젝트의 수익성을 실제로 결정짓는 요소에서 모델이 차지하는 비중은 아주 작습니다. 진짜 가치는 배관(plumbing) — 즉, 검색 (retrieval), 도구 호출 (tool-calling), 승인 (approvals), 그리고 AI의 결정과 기록 시스템 (system of record) 사이의 인계 (handoffs) — 에 존재합니다. 거의 아무도 이를 위해 예산을 편성하지 않습니다. McKinsey QuantumBlack, The State of AI 2025와 Stanford HAI의 2025 AI Index Report의 독립적인 연구 모두, 생산적 가치 창출의 지배적인 장벽은 원시 모델 성능 (raw model capability)이 아니라 통합 (integration), 배포 (deployment), 그리고 거버넌스 (governance)라고 지적합니다.
운영자들에게 이 점을 설명할 때, 저는 직설적으로 말합니다. DeepLearning.AI의 설립자인 Andrew Ng도 공개적으로 같은 점을 언급한 바 있습니다. 그는 자신의 AI Fund 논평에서 다음과 같이 말했습니다. '대부분의 기업에게 병목 현상은 AI 모델이 아니라, 그 주변의 시스템과 워크플로 (workflow)를 구축하는 것이다.' 이것이 바로 이 글에서 명명하고 분석하고자 하는 간극입니다.
맞춤형 SLM — 귀사의 도메인 데이터로 미세 조정(fine-tuned)되어 자체 또는 전용 인프라에서 실행되는 소형 언어 모델 (typically 1B–8B parameters) — 은 무엇보다도 단 한 가지 이유, 즉 '제어권 (control)' 때문에 매력적입니다. 토큰당 비용, 데이터 거주성 (data residency), 지연 시간 (latency), 그리고 드리프트 (drift)에 대한 제어권 말입니다. 반대로 기성 LLM은 정반대의 이유로 매력적입니다. 엔지니어링 비용 (engineering tax) 없이 누릴 수 있는 성능입니다. 토큰 단위로 최첨단 (frontier-level) 추론 능력을 빌려 쓰며, 분기 단위가 아닌 며칠 만에 배포할 수 있습니다.
2026년에 AI로 승리하는 기업은 가장 좋은 모델을 선택한 기업이 아닙니다. 그들은 모델이 결코 병목 현상 (bottleneck)이 아니라는 사실을 깨달은 기업들입니다.
하지만 두 가지 경로 모두 동일한 벽에 부딪히는데, 그것은 모델의 벽이 아닙니다. 바로 조정의 벽 (coordination wall)입니다. 분류기 (classifier)의 정확도가 96%, 검색 (retrieval) 단계가 94%, 초안 작성 (drafting) 단계가 97%, 그리고 라우팅 (routing) 단계가 95%인 지원 자동화 파이프라인 (support-automation pipeline)은 96% 신뢰할 수 있는 시스템이 아닙니다. 이 수치들을 모두 곱하면 약 83%의 엔드 투 엔드 (end-to-end) 신뢰도가 나오며, 이는 약 6번의 상호작용 중 1번은 단일 구성 요소가 책임지지 않는 어딘가에서 실패한다는 것을 의미합니다. 이것이 바로 출시 3개월 후 고객 이탈 (churn) 대시보드에 나타나는 수치입니다.
고안된 프레임워크 (Coined Framework)
AI 조정 격차 (The AI Coordination Gap)
AI 조정 격차 (AI Coordination Gap)란 단일 모델 내부가 아니라, AI 구성 요소와 비즈니스 시스템 사이의 인계 (handoffs) 과정에서 발생하는 복합적인 신뢰도 및 가치 손실을 의미합니다. 이는 모든 개별 모델의 벤치마크가 95% 이상임에도 불구하고 왜 83% 신뢰도의 파이프라인이 고장 난 것처럼 느껴지는지를 설명합니다.
이 글은 '커스텀 SLM vs 기성 LLM'이라는 질문을 진입점으로 삼아, 트렌드 관련 기사들이 다루지 않는 영역, 즉 귀하의 AI 기술 투자가 3배의 수익을 낼지 아니면 4분기에 조용히 폐기될지를 결정하는 조정 아키텍처 (coordination architecture)로 들어갑니다. 우리는 의사결정을 명명된 계층 (layers)으로 나누고, 실제 배포 사례를 보여주며, 이사회에 가져갈 수 있는 정확한 ROI 계산법을 제공할 것입니다.
83%
각 단계의 신뢰도가 95%인 4단계 파이프라인의 엔드 투 엔드 (end-to-end) 신뢰도 — 6번 중 1번의 상호작용 실패
[arXiv, 2025](https://arxiv.org/abs/2307.03109)
...
커스텀 SLM이란 무엇이며, 기성 LLM이란 무엇인가?
두 가지 옵션을 정확하게 정의해 보겠습니다. 대부분의 운영자(operators)들이 이 둘을 혼동하기 때문입니다.
**커스텀 SLM (Custom SLM)**은 소형 언어 모델(Small Language Model)을 의미합니다. Llama 3.1 8B, Phi-3, Mistral 7B 또는 Gemma와 같은 모델을 떠올려 보세요. 이는 여러분의 독점 데이터(proprietary data)로 미세 조정(fine-tuning)하며, 여러분이 제어하는 인프라(전용 GPU 인스턴스, Azure ML 또는 온프레미스 서버)에 배포합니다. 이는 분류(classification), 추출(extraction), 구조화된 요약(structured summarisation), 톤 제어 초안 작성(tone-controlled drafting)과 같이 범위가 좁고, 처리량이 많으며, 경계가 명확한 작업에 대해 오늘날 바로 _프로덕션 적용이 가능(production-ready)_합니다. 다만, 개방형(open-ended)이거나 새로운 작업에 대한 프론티어 추론(frontier reasoning)을 대체할 수는 없습니다. 오픈 웨이트(Open-weight) 옵션들은 Hugging Face에 목록화되어 있으며, Microsoft의 Azure Machine Learning 문서에서 미세 조정 및 배포 경로를 다루고 있습니다.
**기성 LLM (Off-the-shelf LLM)**은 API를 통해 접근하는 프론티어 모델(frontier model)입니다. OpenAI의 GPT-4급 모델, Anthropic의 Claude, 또는 Google AI의 Gemini가 이에 해당합니다. 이는 광범위한 추론, 복잡한 도구 사용(tool-use), 그리고 사전에 완전히 명시할 수 없는 작업에 대해 프로덕션 적용이 가능합니다. 여러분은 능력(capability)과 출시 속도(speed-to-ship)를 얻는 대신, 토큰당 비용과 데이터 거버넌스(data-governance) 오버헤드를 지불하게 됩니다.
| 차원 (Dimension) | 커스텀 SLM (구축) | 기성 LLM (구매) |
|---|---|---|
| 첫 가치 창출까지의 시간 (Time to first value) | 6~16주 | 2~10일 |
| 대규모 운영 시 100만 토큰당 비용 (Cost per 1M tokens at scale) | $1.80 (자체 호스팅 7B) | $11.00 (프론티어 API) |
| 데이터 레지던시 / 거버넌스 (Data residency / governance) | 완전한 제어 가능 | 벤더 의존적 |
| 추론 한계 (Reasoning ceiling) | 좁은 작업에 강함, 일반 작업에 약함 | 일반 작업에 강함 |
| 초기 엔지니어링 비용 (Upfront engineering cost) | $40K–$250K | 거의 제로에 가까움 |
| 지연 시간 (자체 호스팅 기준) (Latency (self-hosted)) | 낮음, 예측 가능함 | 가변적, 네트워크 종속적 |
| 유지보수 부담 (Maintenance burden) | 높음 (MLOps, 재학습) | 낮음 (벤더가 처리) |
| 최적의 용도 (Best for) | 대량의 반복적이고 민감한 작업 | 소량의 복잡하고 개방적인 작업 |
명시적인 손익분기점(Break-even) 공식: 맞춤형 SLM은 (일일 토큰 수 × (LLM 비용 − SLM 비용) × 30) > 월간 분할 구축 비용(monthly_amortised_build_cost)일 때만 보상을 제공합니다. 하루 240만 토큰 사용 시, 2,400,000 × ($0.000011 − $0.0000018) × 30 = 월 약 $20,600를 절감하게 됩니다. 15만 달러의 구축 비용을 18개월로 분할 상환하면(월 약 $8,300), 여유 있게 손익분기점을 넘깁니다. 안정적인 부하가 하루 200만 토큰 미만이라면, 4만~25만 달러에 달하는 엔지니어링 및 MLOps 비용은 결코 회수될 수 없습니다. 모델 비교를 수행하기 전에 먼저 물량 계산(volume math)을 실행하십시오.
한 가지 주목할 점이 있습니다. 이 차원들 중 그 어느 것도 벤치마크(Benchmark) 상의 답변 품질에 관한 것이 아니라는 점입니다. 이는 의도된 것입니다. 두 옵션 모두 벤치마크 결과는 좋을 것입니다. 결정은 리더보드(Leaderboard)에 의한 결정이 아니라, 물량(Volume), 민감도(Sensitivity), 지연 시간(Latency), 그리고 거버넌스(Governance)에 관한 운영상의 결정입니다.
총 소유 비용(Total cost of ownership)은 높고 안정적인 토큰 물량에서 교차합니다. 손익분기점 미만에서는 기성 LLM(Off-the-shelf LLMs)이 속도뿐만 아니라 경제성 측면에서도 승리하며, 이는 구축 대 구매(Build-vs-buy) 논쟁에서 대개 간과되는 미묘한 차이입니다.
AI 조정 격차(AI Coordination Gap)란 무엇이며 왜 ROI를 망치는가?
표준적인 구축 대 구매 프레임워크가 전문 서비스 기업(Professional services firms)에서 실패하는 지점이 바로 여기입니다. 이들은 모델 선택을 최적화하는 데 집중하느라, 실제로 ROI를 결정짓는 계층(Layer)을 무시합니다. 그 계층은 바로 조정(Coordination)이며, 바로 여기서 가치가 누수됩니다.
고안된 프레임워크
AI 조정 격차 (The AI Coordination Gap)
이는 AI 출력이 경계를 넘어야 할 때마다 지불하게 되는 신뢰성 세금(Reliability tax)입니다. 즉, 모델에서 검색(Retrieval)으로, 검색에서 도구(Tool)로, 도구에서 인간으로, 그리고 인간에서 다시 시스템으로 넘어가는 과정입니다. 각 경계는 소유자가 없는 실패 지점(Unowned failure point)이며, 이들의 오류는 곱절로 누적됩니다.
제가 이 사실을 비싼 대가를 치르며 배운 과정을 말씀드리겠습니다. 초기 전문 서비스 (Professional-services) 배포 사례 중 하나에서, 저희는 모델을 완벽하게 만드는 데 6주를 쓰고 라우팅 (Routing)을 연결하는 데 2일을 썼습니다. 그러고 나서 다음 4개월 동안 라우팅을 수정하는 데 시간을 보냈습니다. 문제는 모델이 아니었습니다. 분류기 (Classifier)와 과금 시스템 (Billing system) 사이의 핸드오프 (Handoff) 과정에서 약 9개 중 1개의 레코드가 소리 없이 누락되었고, 그 경계는 두 팀의 코드 사이에 존재했기 때문에 아무도 책임지지 않았습니다. 그 단 하나의 프로젝트 때문에, 저는 이제 누군가가 모델 리더보드 (Model leaderboard)를 열어보기 전에 조정 계층 (Coordination layers)을 먼저 매핑합니다.
중요한 계층들은 다음과 같습니다. SLM을 구축하든 LLM을 구매하든, 이 모든 것이 필요하며 이것이 귀하의 예산이 실제로 반영해야 할 내용입니다.
계층 1: 인테이크 및 라우팅 계층 (The Intake & Routing Layer)
모든 AI 워크플로 (Workflow)는 결정과 함께 시작됩니다: 이것은 무엇이며, 어디로 가야 하는가? 인바운드 지원 티켓, 새로운 고객 인테이크 양식, 이커머스 주문 예외 상황 등이 이에 해당합니다. 여기서 맞춤형 SLM이 빛을 발합니다. 분류 (Classification) 및 라우팅 (Routing)은 미세 조정 (Fine-tuned)된 7B 모델이 저렴하고 빠르게 수행할 수 있는 좁고 대량인 작업입니다. 실제로 팀들은 이를 n8n이나 Azure Logic Apps와 같은 워크플로 자동화 (Workflow automation) 플랫폼에 연결하여, 인바운드 이벤트 발생 시 트리거를 작동시키고 구조화된 메타데이터 (Structured metadata)를 다운스트림 (Downstream)으로 전달합니다.
계층 2: 검색 계층 (The Retrieval Layer (RAG))
모델에는 귀사의 컨텍스트 (Context) — 계약서, 표준 운영 절차 (SOPs), 과거 사건, 제품 카탈로그 등이 필요합니다. 이것이 Pinecone과 같은 벡터 데이터베이스 (Vector database)를 기반으로 하는 검색 증강 생성 (Retrieval-Augmented Generation, RAG)입니다. 여기서 조정 격차 (Coordination Gap)가 가장 뼈아프게 작용합니다. 잘못된 청크 (Chunk)를 조용히 반환하는 검색은 모든 다운스트림 단계를 오염시킵니다. 검색 정확도 (Retrieval accuracy)는 대부분의 전문 서비스 배포에서 가장 영향력이 큰 단일 수치입니다.
계층 3: 추론 계층 (The Reasoning Layer)
이곳은 모델이 실제로 사고하는 단계입니다. 즉, 응답을 초안하고, 다음 행동을 결정하며, 옵션들을 검토합니다. 개방형 추론 (open-ended reasoning)의 경우에는 일반적으로 기성 LLM (off-the-shelf LLM)이 유리합니다. 반면, 제약 조건이 있고 형식이 고정된 생성 (예: 컴플라이언스 요약, 추출된 송장)의 경우에는 맞춤형 SLM (custom SLM)이 더 저렴하며 종종 더 일관된 결과를 보여줍니다.
계층 4: 도구 및 행동 계층 (The Tool & Action Layer (MCP))
출력값은 무언가를 _수행_해야 합니다. CRM을 업데이트하거나, 환불을 처리하거나, 예약 슬롯을 잡거나, 문서를 제출하는 것과 같은 작업 말입니다. 이곳에 Model Context Protocol (MCP)와 구조화된 도구 호출 (structured tool-calling)이 존재합니다. 이 단계를 잘못 설정하면, 훌륭한 조언은 제공하지만 실제 행동은 전혀 취하지 못하는 AI를 갖게 됩니다.
계층 5: 인간 참여 계층 (The Human-in-the-Loop Layer)
전문 서비스 분야에서 승인 단계 (approval gates)는 선택 사항이 아니라 책임 관리 (liability management)의 핵심입니다. 변호사가 초안을 최종 승인하고, 회계사가 항목을 승인합니다. 여기서 조율의 과제는 인간이 시스템을 우회하지 않고 실제로 사용하도록 만들 수 있을 만큼 매끄러운 인수인계 (handoff)를 구현하는 것입니다.
계층 6: 관측 가능성 계층 (The Observability Layer)
보이지 않는 조율 격차 (Coordination Gap)는 해결할 수 없습니다. 모든 경계에는 로깅 (logging), 추적 (tracing), 그리고 평가 (evaluation)가 필요합니다. 팀들이 흔히 건너뛰는 계층이 바로 이곳이며, 이것이 바로 3개월 뒤에 실패 원인을 설명하지 못하는 이유입니다.
전문 서비스 AI를 위한 6계층 조율 아키텍처 (The Six-Layer Coordination Architecture for Professional Services AI)
1
**수집 및 라우팅 (Intake & Routing) (Custom SLM + Azure Logic Apps)**
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
