LangSmith를 활용하여 에이전트 동작을 최적화하고 엔지니어링 개입을 90% 줄인 Podium의 사례
요약
Podium은 고객 문의 응답 속도를 높이기 위해 AI Employee 에이전트를 개발했습니다. 초기 LangChain 사용에서 한계를 느껴, LLM 호출 및 상호작용의 가시성을 확보하기 위해 LangSmith를 도입했습니다. 이를 통해 에이전트 개발 수명 주기 전반에 걸쳐 체계적인 테스트와 최적화가 가능해졌습니다.
핵심 포인트
- LangSmith 활용으로 에이전트 성능 모니터링 및 테스트 용이성 확보
- 기준 데이터셋 구축부터 지속적인 엣지 케이스 추가까지 체계적인 평가 루프 운영
- 오프라인/온라인 평가, 프롬프트/검색 증강 튜닝 등 다각적 최적화 진행
- 에이전트 개발 수명 주기 전반의 가시성 확보가 핵심 성공 요인
Podium 소개
Podium은 전화, 문자, 이메일 및 소셜 미디어를 통해 소규모 비즈니스가 고객과 빠르게 연결될 수 있도록 돕는 커뮤니케이션 플랫폼입니다. 소규모 비즈니스는 종종 자동차 딜러, 주얼리점, 자전거 가게와 같이 고객과 높은 수준의 상호작용을 하지만 인력이 부족한 경우가 많습니다. Podium의 목표는 이러한 비즈니스가 고객 문의에 신속하게 응답하여 리드를 판매로 전환할 수 있도록 돕는 것입니다.
Podium 데이터에 따르면, 고객 문의에 5분 이내로 응답하는 것이 한 시간 후에 응답하는 것보다 리드 전환율을 46% 높입니다. 리드 확보를 개선하기 위해 Podium은 현지 비즈니스 고객과 상호작용하고, 약속을 예약하며, 판매를 성사시키는 에이전트 애플리케이션(주력 제품)인 AI Employee를 출시했습니다.
초기에는 Podium이 단일 턴(single-turn) 상호작용에 LangChain 프레임워크를 사용했습니다. 하지만 다양한 고객과 도메인에 걸쳐 에이전트 사용 사례가 더욱 복잡해지면서, Podium은 LLM 호출 및 상호작용에 대한 더 나은 가시성이 필요했고, 이를 위해 LLM 테스트 및 관찰 가능성을 위해 LangSmith로 향하게 되었습니다.
에이전트 개발 수명 주기 전반의 테스트
피드백 루프를 구축하는 것은 Podium에게 에이전트 개발 수명 주기에 특히 중요했습니다. LangSmith는 Podium 엔지니어들이 AI Employee의 성능을 테스트하고 지속적으로 모니터링할 수 있게 했으며, 데이터셋에 새로운 엣지 케이스(edge cases)를 추가하여 시간이 지남에 따라 모델을 개선하고 테스트할 수 있도록 했습니다.
Podium의 테스트 접근 방식은 다음과 같습니다:
기준 데이터셋 구축 (Baseline Dataset Curation): 에이전트의 기본적인 사용 사례와 요구사항을 나타내는 초기 데이터셋을 생성합니다. 이는 테스트 및 개발의 기반 역할을 합니다.기준 오프라인 평가 (Baseline Offline Evaluation): 큐레이션된 데이터셋을 사용하여 초기 테스트를 수행하고, 프로덕션 배포 전에 기본 요구사항에 대한 에이전트의 성능을 평가합니다.**피드백 수집 (Collecting Feedback):**사용자 제공 피드백 (User-Provided Feedback): 에이전트와 상호작용하는 사용자로부터 직접적인 입력을 수집합니다.온라인 평가 (Online Evaluation): LLM을 사용하여 실시간으로 응답의 품질을 자체 평가하고 모니터링하며, 추가 조사가 필요한 잠재적 문제를 플래그 지정합니다.## **최적화 (Optimization):**프롬프트 튜닝 (Prompt Tuning): 에이전트의 응답을 안내하는 데 사용되는 프롬프트를 개선합니다.검색 증강 튜닝 (Retrieval Tuning): 응답을 생성하는 데 사용되는 검색 메커니즘을 조정합니다.모델 미세 조정 (Model Fine-Tuning): 추적된 데이터(traced data)를 사용하여 모델을 추가로 학습시키고 특정 작업에 특화시킵니다.## **지속적인 평가 (Ongoing Evaluation):**오프라인 평가 (Offline Evaluation): 백테스팅, 쌍별 비교 등 다른 테스트 방법을 사용하여 에이전트의 성능을 평가하고 최적화 기회를 식별합니다.데이터셋 큐레이션 (Dataset Curation): 회귀 테스트(regression testing)를 위해 새로운 시나리오와 엣지 케이스로 테스트 데이터셋을 지속적으로 업데이트하고 확장하여, 새로운 변경 사항이 기존 기능에 부정적인 영향을 미치지 않도록 보장합니다.## 
Podium이 AI 직원과 관련하여 직면했던 한 가지 구체적인 어려움은 에이전트가 대화가 자연스럽게 끝났을 때를 인식하는 데 어려움을 겪어 어색하게 반복되는 작별 인사를 하는 경우였습니다. 이를 해결하기 위해 Podium은 다양한 대화 시나리오, 즉 여러 대화가 끝날 수 있는 방식들을 포함하여 LangSmith에 데이터셋을 구축하기 시작했습니다.
이후 그들의 엔지니어링 팀은 더 큰 모델로 업그레이드하는 것이 유용하다는 것을 발견했고, 이 출력을 작은 모델로 정제(model distillation)하는 기술을 사용하여 만들었습니다. 모델 업그레이드는 모델 입력과 출력이 LangSmith의 추적(traces)에 자동으로 캡처되었기 때문에 순조롭게 진행되었으며, 팀은 데이터셋을 쉽게 구축할 수 있었습니다.
Podium 엔지니어들은 또한 고객 프로필, 비즈니스 유형 및 그들의 비즈니스에 중요한 기타 매개변수와 같은 메타데이터를 LangSmith 추적에 풍부하게 추가했습니다. 그들은 특정 식별자를 사용하여 LangSmith에서 추적들을 그룹화함으로써 데이터 구축 과정에서 관련 추적들을 쉽게 집계할 수 있었습니다. 이처럼 풍부해진 데이터는 Podium이 더 높은 품질의 균형 잡힌 데이터셋을 만들 수 있게 했고, 이는 모델 미세 조정(model fine-tuning)을 개선하고 과적합(overfitting)을 피하는 데 도움을 주었습니다.)
이렇게 균형 잡힌 데이터셋을 가지고 Podium 팀은 이후 쌍별 평가(pairwise evaluations)를 사용하여 미세 조정된 모델의 결과와 원래의 더 큰 모델의 결과를 비교했습니다. 이 비교를 통해 업그레이드된 모델이 에이전트가 언제 대화를 종료해야 하는지 아는 능력을 얼마나 향상시킬 수 있는지 평가할 수 있었습니다.
미세 조정 후, Podium의 새로운 모델은 에이전트에게 자연스러운 대화가 끝나는 지점을 감지하는 데 있어 상당한 개선을 보여주었습니다. 미세 조정된 모델을 사용했을 때 Podium의 F1 점수는 91.7%에서 98.6%로 7.5% 향상되어 품질 기준점인 98%를 초과했습니다.
엔지니어링 개입 없이 AI 플랫폼에 대한 고품질 고객 지원
Podium에서는 엔지니어가 고객과의 커뮤니케이션이 잘못될 때(go awry) 언제 발생하는지 이해해야 하므로, 신뢰할 수 있고 고품질의 제품을 계속 출시할 수 있습니다.
Podium은 AI 직원을 공개적으로 출시한 이후, Technical Product Specialists (TPS) 팀이 사용자들이 겪는 문제를 실시간으로 문제 해결하는 것이 매우 중요해졌습니다. Podium에서 TPS 팀은 일반적으로 소규모 비즈니스 고객들을 위한 고객 지원을 제공합니다. 하지만 문제의 근원지를 파악하고(그리고 어떻게 조치를 취할지 결정하는 것)는 어려웠습니다.
TPS 팀에게 LangSmith에 대한 접근 권한이 주어지자 명확성이 생겼고, 팀은 고객이 보고한 문제를 신속하게 식별하고 다음을 판단할 수 있게 되었습니다: “이 문제는 애플리케이션의 버그 때문인가, 불완전한 컨텍스트(context) 때문인가, 잘못 정렬된 지침(misaligned instructions) 때문인가, 아니면 LLM 문제인가?”
Podium에게 있어 고객 문제 유형을 식별하는 것은 적절한 개입 방향을 제시했습니다:
애플리케이션 버그의 경우: 통합이 데이터를 반환하지 못하는 것과 같은 오케스트레이션(orchestration) 실패가 이에 해당합니다. 이는 엔지니어링 개입이 필요합니다.불완전한 컨텍스트의 경우: LLM이 질문에 답하는 데 필요한 정보를 누락한 경우입니다. 이는 TPS 팀이 추가 콘텐츠를 추가하여 해결할 수 있습니다.잘못 정렬된 지침의 경우: 지침은 비즈니스 요구사항을 기반으로 합니다. 요구사항에 문제가 있으면 에이전트 동작에 영향을 줄 수 있습니다. 이는 TPS 팀이 콘텐츠 작성 시스템에서 변경을 가하여 비즈니스 요구사항에 더 잘 맞도록 수정함으로써 해결할 수 있습니다.LLM 문제의 경우: 필요한 컨텍스트가 있음에도 불구하고 LLM이 예상치 못하거나 부정확한 정보를 생성할 수 있습니다. 이는 엔지니어링 개입이 필요합니다.
예를 들어, 많은 자동차 딜러십은 Podium의 AI 직원을 사용하여 고객 문의에 응답합니다. 만약 AI 직원이 실수로 해당 딜러십에서 오일 교환 서비스를 제공하지 않는다고 응답한다면, TPS 팀은 LangSmith의 플레이그라운드(playground) 기능을 사용하여 시스템 출력을 편집하고 관리자 인터페이스(Admin interface)의 간단한 설정 변경만으로 문제를 해결할 수 있는지 판단할 수 있습니다.

LangSmith Playground는 Podium 지원팀이 엔지니어링 개입 없이 에이전트 동작을 문제 해결할 수 있도록 합니다
이전에는 LangSmith를 사용하기 전에는 에이전트 동작을 문제 해결하는 과정에서 엔지니어링 개입이 필요한 경우가 많았습니다. 이는 모델의 입력과 출력을 검토하고, 코드를 다시 작성하고 리팩터링하는 과정을 거쳐야 하므로 시간이 많이 소요되는 작업이었습니다.
Podium은 TPS 팀에 LangSmith 트레이스(traces) 접근 권한을 부여함으로써 엔지니어링 개입 필요성을 90%까지 줄였으며, 엔지니어들이 지원 업무 대신 개발에 더 집중할 수 있게 되었습니다.
요약하자면, LangSmith를 사용하면서 다음과 같은 성과를 거두었습니다:
- Podium의 지원팀 효율성 증가: 문제를 더 빠르고 독립적으로 해결할 수 있게 되면서 이루어졌습니다.
- 고객 만족도(CSAT) 점수 개선: 지원 상호작용 및 Podium의 AI 기반 서비스 모두에서 개선되었습니다.
Podium의 다음 계획
LangSmith와 LangChain을 통합함으로써, Podium은 고객 경험 도구 분야에서 경쟁 우위를 확보했습니다. LangSmith는 관측 가능성(observability)을 향상시키고 대규모 데이터셋 관리 및 모델 성능 최적화를 간소화했습니다. 또한 Podium 팀은 다양한 대상 고객에게 서비스를 제공하면서 에이전트 오케스트레이션의 복잡성을 줄이고 에이전트 대화에 대한 제어력을 높이는 LangGraph를 워크플로우에 통합하고 있습니다.
종합적으로, 이러한 제품군은 Podium이 핵심 가치 제안(small businesses capture leads more effectively) — 즉, 소규모 비즈니스가 리드를 더 효과적으로 확보하도록 돕는 것 — 에 집중할 수 있게 했으며, LLM 애플리케이션을 효율적으로 설계하고 테스트하며 모니터링할 수 있도록 했습니다.
Podium은 지역 사업체가 성공하는 데 도움을 주기 위해 다양한 역할에 걸쳐 인재를 채용하고 있습니다. Podium의 이야기에 영감을 받으셨나요? 무료로 LangSmith를 사용해 보거나, 더 자세한 내용을 알아보기 위해 LangSmith 전문가와 상담할 수 있습니다.
**LLM 애플리케이션 테스트 및 평가에 대한 보다 포괄적인 모범 사례(best practices)는 이 가이드북을 확인하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기