
소매업의 AI 기술: 맞춤형 SLM vs 기성품 LLM
요약
소매업 환경에서 맞춤형 SLM과 기성품 LLM 중 무엇을 선택해야 하는지에 대한 결정 가이드를 제공합니다. 모델의 크기보다 지연 시간, 비용, 그리고 기존 시스템과의 통합 및 조정 계층 설계가 성공의 핵심임을 강조합니다.
핵심 포인트
- 소매 AI의 핵심은 모델 크기가 아닌 시스템 간의 조정(Coordination)임
- 맞춤형 SLM과 기성품 LLM의 비용, 지연 시간, 통합 방식을 비교 분석
- AI 조정 격차(Coordination Gap)를 해결하는 설계가 중요함
- 사용 사례에 따른 적절한 모델 선택과 인프라 연결 전략 제시
원문은 twarx.com에서 처음 게시되었습니다 - 전체 대화형 버전은 그곳에서 읽어보세요.
최종 업데이트: 2026년 7월 15일
소매업에서의 **AI 기술 (AI technology)**은 모델 크기로 승패가 갈리는 경우가 거의 없습니다. 이번 주 트렌드인 상위 20개 무인 결제 매장(checkout-free stores)은 한 가지 화려하지 않은 비밀을 공유하고 있습니다. 그들 중 어느 곳도 언어 모델의 크기로 승리한 것이 아니라는 점입니다. 그들은 AI 시스템이 선반 끝(shelf edge)에서 재고, 결제 및 비전 파이프라인(vision pipelines)과 얼마나 잘 조정되었느냐로 승리했습니다. 한편, 이번 주 화제가 되고 있는 미국 대 일본의 AI 기술 도입 격차는 사실 문화나 자본의 문제가 아닙니다. 그것은 어떤 기업이 아무도 설계하지 않은 시스템 간의 핸드오프(handoff) 문제를 해결했느냐에 관한 것입니다. 대부분의 소매 AI 기술 워크플로우는 완전히 잘못된 문제를 해결하고 있습니다.
이 글은 특정 선택을 위한 결정 가이드입니다: **맞춤형 소형 언어 모델 (Custom Small Language Model, SLM)**을 배포할 것인가, 아니면 GPT급 모델, Claude, 또는 Gemini와 같은 **기성품 LLM (off-the-shelf LLM)**에 의존할 것인가에 대한 것입니다. 도구들은 오늘날 즉시 생산에 투입할 수 있는 수준입니다 — OpenAI의 API, Anthropic의 Claude, 오케스트레이션(orchestration)을 위한 LangGraph, 그리고 자체 카탈로그에 맞춰 미세 조정(fine-tune)할 수 있는 Phi 및 Llama 변형과 같은 오픈 SLM 등이 있습니다.
이 글을 읽고 나면, 사용 사례별로 정확히 무엇을 배포해야 하는지, 비용은 얼마인지, 그리고 두 모델 중 어느 것이 실제로 작동할지를 결정하는 조정 계층(coordination layer)을 어떻게 설계해야 하는지 알게 될 것입니다.
소매업 AI 결정은 모델 품질만으로 결정되는 경우가 거의 없습니다. 이는 지연 시간(latency), 호출당 비용(cost-per-call), 그리고 모델이 기존의 주문 및 재고 시스템에 어떻게 연결되는지에 달려 있습니다. 이것이 바로 AI 조정 격차(AI Coordination Gap)가 존재하는 지점입니다.
개요: SLM vs LLM 논쟁이 핵심을 놓치는 이유
대부분의 소매업 운영자가 고통스러운 경험을 통해 배우게 되는 직관에 반하는 사실이 있습니다. 바로 모델 자체가 병목 현상의 원인인 경우는 드물다는 점입니다. 프론티어 LLM (Frontier LLM)은 데모 환경에서 제품 관련 질문에 아주 훌륭하게 답변할 것입니다. 하지만 이 모델을 실제 재고 피드, Shopify 주문 객체, 반품 정책 엔진, 그리고 3PL 웹훅 (3PL webhook)에 연결하는 순간, 그 어떤 것도 서로 조율되도록 설계되지 않았기 때문에 전체 시스템의 성능이 저하됩니다.
각 단계의 신뢰도가 97%인 6단계 소매 자동화 파이프라인(retail automation pipeline)은 엔드 투 엔드 (end-to-end) 관점에서 볼 때 신뢰도가 약 83%에 불과합니다. 대부분의 팀은 이를 프로덕션 (production) 환경에 이미 배포한 후에야 깨닫게 되는데, 고객들이 잘못된 배송 예상치를 받기 시작하고 정작 어느 단계에서 오류가 발생했는지 아무도 찾아내지 못할 때 말입니다. 바로 이 지점이 사려 깊은 AI 기술 아키텍처 (AI technology architecture)가 프로덕션 시스템과 데모를 구분 짓는 지점입니다.
소매 AI 분야에서 승리하고 있는 기업들은 가장 큰 모델을 가진 기업들이 아닙니다. 모델과 모델이 접촉해야 하는 모든 시스템 간의 조율(coordination) 문제를 해결한 기업들입니다.
맞춤형 SLM (custom SLM) 대 기성품 LLM (off-the-shelf LLM) 문제는 사실 하나의 외투를 입고 있는 두 개의 질문과 같습니다. 첫 번째 질문은 '특정 작업에 대해 어떤 모델이 달러당 최고의 품질을 제공하는가?'입니다. 두 번째 질문 — 즉, 실제로 ROI (투자 대비 수익)를 결정짓는 질문 — 은 '모델이 조율 실패 (coordination failures)를 일으키지 않으면서 운영 스택 (operational stack)에 얼마나 깔끔하게 연결되는가?'입니다.
맞춤형 SLM (Custom SLMs, 일반적으로 1B–8B 파라미터 규모이며 특정 도메인에 맞춰 미세 조정됨)은 비용, 지연 시간 (latency), 개인정보 보호 (privacy), 그리고 예측 가능성 (predictability) 측면에서 승리합니다. 자체 인프라에서 실행되는 미세 조정된 Phi-3 또는 Llama-3.1-8B는 데이터가 VPC를 벗어나지 않으면서도, 100ms 미만의 지연 시간으로 단 몇 센트의 아주 적은 비용만 사용하여 제품 분류 (product-classification) 또는 의도 라우팅 (intent-routing) 작업을 처리할 수 있습니다. 반면, 기성품 LLM (Off-the-shelf LLMs)은 추론의 폭 (reasoning breadth), 제로샷 유연성 (zero-shot flexibility), 그리고 가치 창출 시간 (time-to-first-value) 측면에서 승리합니다. Claude 기반의 고객 지원 에이전트를 단 한나절 만에 출시할 수 있기 때문입니다. 두 진술 모두 사실입니다. 하지만 어느 쪽도 실제로 무엇을 배포해야 하는지는 알려주지 않습니다. Phi-3 기술 보고서 (the Phi-3 technical report)에 관한 최근 학술 연구는 소형 모델들이 얼마나 유능해졌는지를 강조합니다.
10-30x
대량의 라우팅 작업을 프론티어 LLM에서 미세 조정된 SLM으로 전환할 때 발생하는 비용 절감 효과
[arXiv SLM 효율성 연구, 2025](https://arxiv.org/abs/2409.15790)
...
최근 유행하는 무인 결제 매장 (checkout-free stores)이 가장 명확한 증거입니다. Amazon 스타일의 'Just Walk Out'과 그 경쟁사들은 하나의 거대한 LLM이 아니라, 작고 특화된 비전 (vision) 및 대조 (reconciliation) 모델을 실행합니다. 이는 매대에서의 대화 능력보다 지연 시간과 거래당 비용이 더 중요하기 때문입니다. 지능은 모델의 규모가 아니라 조정 (coordination)에 존재합니다.
새롭게 명명된 프레임워크
AI 조정 격차 (The AI Coordination Gap)
AI 조정 격차 (The AI Coordination Gap)란 AI 모델과 모델이 상호작용해야 하는 운영 시스템 (operational systems) 사이에서 발생하는 복합적인 신뢰성 및 비용 손실을 의미합니다. 이는 단일 모델이 책임질 수 없는 핸드오프 (handoffs), 형식 불일치 (format mismatches), 그리고 상태 동기화 (state syncs) 문제를 포함합니다. 이 용어는 왜 대부분의 리테일 AI 프로젝트가 유능한 모델을 사용함에도 불구하고 데모 성능에 미치지 못하는지를 설명해 줍니다.
아래에서 저는 이 의사결정을 6계층 프레임워크(six-layer framework)로 나누어 설명하고, 각 계층이 실제 환경에서 어떻게 작동하는지 보여주며, 미국과 일본 리테일러의 실제 배포 사례를 살펴본 뒤, 구현 FAQ로 마무리하겠습니다. 이 글은 슬라이드용 자료(slideware)를 평가하는 사람이 아니라, 실제로 제품을 출시(ship)해야 하는 운영자를 위해 작성되었습니다. 더 넓은 맥락을 먼저 파악하고 싶다면, 저희의 프로덕션 환경에서의 소형 언어 모델(small language models in production) 입문서를 읽어보시기 바랍니다.
SLM vs LLM 결정을 위한 6계층 프레임워크
모든 리테일 AI 의사결정은 6개의 계층으로 귀결됩니다. 각 계층에서 모델 선택을 올바르게 하면 AI 조정 격차(AI Coordination Gap)가 줄어듭니다. 선택이 틀리면 지연 시간(latency), 환각(hallucination)이 발생한 배송 날짜, 그리고 아무도 설명할 수 없는 고객 지원 티켓(support tickets)이라는 대가를 치르게 됩니다.
리테일 AI 의사결정 6계층 스택 (The Six-Layer Retail AI Decision Stack)
1
**계층 1 — 작업 분류 (Task Classification) (SLM 영역)**
의도 라우팅(Intent routing), 상품 카테고리 분류, 감성 태깅(sentiment tagging). 높은 처리량, 좁은 범위, 지연 시간에 민감함. 미세 조정(Fine-tuned)된 Phi-3 또는 DistilBERT급 모델. 50ms 미만, 호출당 $0.0001 미만.
↓
2
...
벡터 데이터베이스(Vector database) (Pinecone, pgvector)가 카탈로그, 정책 및 주문 컨텍스트를 가져옵니다. 이 계층은 상위에서 실행되는 모델에 데이터를 공급합니다. 데이터의 최신성(freshness)과 근거 제시(grounding)를 담당합니다.
↓
3
...
다단계 고객 문제 해결, 복잡한 반품, 예외 상황(edge-case) 처리. GPT급 또는 Claude. 계층 1에서 에스컬레이션(escalate)될 때만 호출됩니다. 비용은 더 높지만, 복잡성에 의해 정당화됩니다.
↓
4
...
조정 계층(coordination layer). 상태(state), 재시도(retries), SLM과 LLM 간의 핸드오프(handoffs)를 관리하고 가드레일(guardrails)을 적용합니다. 이곳이 바로 AI 조정 격차가 해소되거나 상실되는 지점입니다.
↓
5
...
모델 컨텍스트 프로토콜(Model Context Protocol)이 표준화된 계약을 통해 모델을 Shopify, ERP, 3PL 및 결제 API에 연결합니다. 통합마다 별도의 맞춤형 글루 코드(glue code)를 작성할 필요를 없애줍니다.
↓
6
...
모든 핸드오프를 추적하고, 실패를 기록하며, 교정된 출력을 다시 SLM 미세 조정(fine-tuning)에 파이프라인으로 연결합니다. 조정 실패를 학습 데이터로 전환합니다.
순서가 중요합니다. 저렴한 SLM은 레이어 1-2에서 대량의 요청을 처리하고, 값비싼 LLM은 레이어 3에서 예외 상황을 처리하며, 오케스트레이션 레이어(4-5)가 실제로 프로덕션 환경에서 시스템이 유지될지 여부를 결정합니다.
레이어 1 — 작업 분류 (Task Classification): SLM의 본진
소매 운영에서의 AI 호출 중 약 70-80%는 좁고 반복적인 작업입니다: '이것이 배송 관련 질문인가, 아니면 반품 관련 질문인가?', '이것은 나의 4,000개 SKU 중 어떤 것을 설명하는가?', '이 리뷰는 긍정적인가, 부정적인가, 아니면 중립적인가?' 이러한 작업에는 4,000억 개의 파라미터를 가진 모델이 필요하지 않습니다. 밀리초(ms) 단위로 응답하며 비용이 거의 들지 않는 미세 조정(fine-tuned)된 SLM이 필요합니다.
단일 GPU에서 실행되는 미세 조정된 Llama-3.1-8B 또는 Microsoft Phi-3-mini는 40-80ms 내에 의도(intent)를 분류할 수 있으며, 모델 학습 후에는 한계 비용이 사실상 제로에 가깝습니다. 동일한 호출을 프런티어(frontier) LLM API로 보내면 토큰당 비용을 지불해야 하고, 네트워크 지연 시간(latency)이 추가되며, 블랙 프라이데이(Black Friday)와 같이 가장 피해야 할 급증 시기에 벤더의 속도 제한(rate limits)을 그대로 물려받게 됩니다. Meta의 Llama 3.1 릴리스 노트는 이러한 경제성을 가능하게 하는 8B 미만 변체들을 기록하고 있습니다. 비용 측면의 트레이드오프(trade-off)를 확인하려면 OpenAI의 공개 API 가격과 비교해 보십시오.
AI 호출의 60% 이상이 분류 또는 라우팅(routing)이라면, 해당 레이어에 미세 조정된 SLM을 배포하는 것은 일일 호출 5,000건 이상 기준 보통 90일 이내에 학습 비용을 회수합니다. 이보다 호출량이 적다면 기성품(off-the-shelf) LLM을 그대로 사용하십시오. 계산 결과의 차이가 매우 큽니다.
레이어 2 — 검색 (Retrieval): 모델 불가지론적(Model-Agnostic)이며 타협 불가능한 요소
RAG (Retrieval-Augmented Generation, 검색 증강 생성)는 어떤 모델이든 정직함을 유지하게 만드는 레이어입니다. 가격은 변합니다. 재고도 변합니다. 반품 정책도 변합니다. SLM이든 LLM이든, 고정된 가중치 (frozen weights)로부터 답변하는 모델은 단종된 제품이 재고가 있다고 고객에게 자신 있게 말할 것입니다. 저는 실제 운영 환경 (production)에서 이런 일이 발생하는 것을 보았습니다. 이것은 모델의 실패가 아니라, 아키텍처 (architecture)의 실패입니다. Pinecone이나 pgvector와 같은 벡터 데이터베이스 (vector database)를 기반으로 하는 검색 레이어는 모든 답변을 최신 데이터에 근거하게 합니다. 이 기초적인 기술은 Facebook AI Research의 원본 RAG 논문으로 거슬러 올라갑니다.
이것이 바로 SLM 대 LLM 논쟁이 종종 논점을 흐리는 (red herring) 이유입니다. 소형 모델을 사용하더라도 검색 성능이 떨어지는 대형 모델보다 잘 구축된 RAG 레이어를 갖춘 모델이 더 나은 성능을 보이는 경우가 빈번합니다. 모델 크기에 집착하기 전에 운영 환경을 위한 RAG 파이프라인 구축에 대해 더 자세히 알아보세요.
명명된 프레임워크 (Coined Framework)
AI 조정 격차 (The AI Coordination Gap)
표준화된 인터페이스 (standardized interface) 없이 모델이 통신해야 하는 시스템을 추가할 때마다 AI 조정 격차 (AI Coordination Gap)는 넓어집니다. 두 시스템은 하나의 인계 지점 (handoff)을 만들지만, 여섯 개의 시스템은 15개의 가능한 인계 지점을 만듭니다. 그리고 각 지점은 조용한 실패 (silent failure)가 발생할 수 있는 장소가 됩니다.
레이어 3 — 추론 (Reasoning): 실제로 대형 모델이 필요한 시점
일부 작업은 진정으로 최첨단 추론 (Frontier Reasoning) 능력을 필요로 합니다. 부분 환불, 파손된 품목, 그리고 충성도 크레딧(Loyalty Credit)이 동시에 적용되어야 하는 고객 사례나, 사기(Fraud)에 인접한 예외적인 케이스, 그리고 공감과 정책 해석을 동시에 수행해야 하는 미묘한 불만 사항 등이 이에 해당합니다. 바로 이 지점이 기성품 LLM (Off-the-shelf LLMs)이 높은 비용을 지불할 가치가 있는 부분입니다. 핵심적인 아키텍처 결정 사항은 레이어 1의 SLM (Small Language Model)이 낮은 신뢰도나 높은 복잡성을 감지했을 때만 LLM으로 라우팅(Routing)하는 것입니다. 이러한 에스컬레이션(Escalation) 패턴은 소매 AI 기술에서 비용을 조절할 수 있는 가장 큰 레버(Lever)이며, 저는 이를 목록의 그 어떤 것보다 중요하게 생각합니다. Anthropic의 Claude 3 모델 제품군 발표는 최첨단 추론이 진정으로 제 역할을 다해야 하는 지점이 어디인지를 잘 설명해 줍니다.
처리량의 80%는 저렴한 SLM으로 라우팅하고, 어려운 20%만 최첨단 LLM으로 에스컬레이션하십시오. 이 단 하나의 설계 결정만으로 품질을 저하시키지 않고도 AI 비용을 10배(An order of magnitude)까지 절감할 수 있습니다.
레이어 4 — 오케스트레이션 (Orchestration): 격차가 승패를 가르는 지점
오케스트레이션 레이어가 실제 제품입니다. LangGraph (프로덕션 환경에 적합한 그래프 기반 상태 관리)와 Microsoft의 AutoGen (대화형 멀티 에이전트 패턴에 강력함)을 사용하면 SLM이 실행되는 시점, 에스컬레이션이 발생하는 시점, 재시도(Retry)가 이루어지는 방식, 그리고 어떤 가드레일(Guardrails)이 작동할지를 제어하는 상태 머신(State Machine)을 정의할 수 있습니다. 이 레이어가 없다면 여러분은 시스템이 아닌, 그저 모델 호출의 더미(Pile)를 갖게 될 뿐입니다. 이는 과장이 아닙니다. 저는 정확히 그런 상태였던 소매 AI 설정들을 감사(Audit)해 왔으며, 그것들은 정말로 디버깅하기 어려운 방식으로 실패하곤 합니다.

미세 조정된(Fine-tuned) SLM 분류기와 에스컬레이션을 위한 기성품 LLM을 조정하는 LangGraph 상태 그래프. 오케스트레이션 레이어는 AI 조정 격차(AI Coordination Gap)가 해소되는 지점입니다.
레이어 5 — 도구 및 시스템 인터페이스 (Tool & System Interface): MCP가 계산 방식을 바꾼다
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기