LangSmith Tuned Evaluators 소개
요약
LangSmith의 Tuned Evaluators는 에이전트 상호작용을 분석하고 Perceived Error와 같은 품질 피드백을 자동으로 첨부하는 도구입니다. 이 기능은 복잡한 평가 시스템 구축 없이도 낮은 비용으로 높은 정확도의 평가를 제공하여, 프로덕션 환경에서 에이전트 개선 워크플로우를 효율화합니다.
핵심 포인트
- 자동화된 품질 피드백: Perceived Error 등 유용한 신호를 트레이스에 자동으로 첨부합니다.
- 엔지니어링 부담 감소: LLM-as-judge 모델 관리, 버전 관리 등을 LangChain이 처리하여 턴키 솔루션을 제공합니다.
- 비용 효율성 극대화: 특수 학습된 모델을 사용하여 평가 비용을 최대 82% 절감하면서도 최첨단 성능을 유지합니다.
핵심 요약
프로덕션 트레이스에 유용한 신호를 자동으로 첨부합니다. Tuned Evaluators는 에이전트 상호작용을 분석하고, 팀이 에이전트 개선 워크플로우에서 사용할 수 있는 피드백(Perceived Error를 시작으로)을 첨부합니다.
완벽하게 관리되는 턴키 평가 도구를 얻습니다. 팀은 복잡한 프롬프트를 작성하거나 유지보수할 필요가 없으며, LLM-as-judge 모델을 선택하거나 버전 관리하거나 자격 증명을 관리하거나 추론 인프라를 운영할 필요도 없습니다. LangChain이 이를 엔드투엔드로 처리합니다.
훨씬 적은 비용으로 최첨단 수준의 정확도를 얻습니다. Perceived Error는 LangChain이 훈련한 특수 모델을 사용하여, 평가 비용을 최대 82% 절감하면서도 최첨단 성능을 능가했습니다.
프로덕션에 있는 모든 대화형 에이전트는 Perceived Error에 대한 평가가 필요합니다. 이는 에이전트가 사용자에게 도움이 되는 경험을 제공하고 있는지 여부에 대한 가장 명확한 신호 중 하나입니다.
지금까지 Perceived Error를 평가하는 것은 비용이 많이 들고 확장하기 어려웠습니다. 팀들은 최첨단 모델 호출에 의존해야 했고, 트레이스의 작은 일부만 샘플링했으며, 평가 도구를 수동으로 조정하는 데 시간을 소비해야 했습니다.
오늘날, 저희는 Tuned Evaluators를 소개합니다. 이는 프로덕션 트레이스 및 스레드에 품질 피드백을 자동으로 첨부하여, 팀이 주의가 필요한 동작을 찾고, 무엇이 잘못되었는지 이해하며, 에이전트를 개선하기 위한 조치를 취할 수 있도록 합니다.
각 Tuned Evaluator는 특정 목표를 위한 완성되고 버전화된 평가 도구입니다. LangChain은 이미 해당 목표를 프로덕션 준비가 된 judge로 만드는 작업을 완료했습니다. 팀은 필요한 평가 도구를 선택하고 트레이싱 프로젝트에 연결하기만 하면 됩니다.
모든 대화에서 실행되는 고품질, 저비용 Judge
프로덕션 트레이스 전반에 걸쳐 높은 품질의 평가를 적용하는 것은 전통적으로 팀들이 정확도와 커버리지 사이에서 선택하도록 강요해 왔습니다.
최첨단 모델(Frontier models)은 강력한 판단을 제공할 수 있지만, 이를 많은 프로덕션 대화에 적용하는 것은 비용이 많이 듭니다. 더 작은 모델은 비용이 적게 들지만, 낮은 정확도 때문에 어떤 트레이스에 주의를 기울여야 할지 신뢰하기 어렵습니다. 그 결과, 많은 팀들이 스레드(threads)의 일부 샘플만 평가하게 되는데, 이는 에이전트가 고객에게 나쁜 경험을 제공하고 있다는 중요한 신호를 놓칠 위험이 있습니다.
추론 비용은 작업의 일부일 뿐입니다. 신뢰할 수 있는 평가기(evaluator)를 구축하는 것에는 행동 정의, 모호한 사례 해결, 레이블 생성, 심사위원(judge) 선택 및 벤치마킹, 그리고 모델과 프로덕션 동작이 변경됨에 따라 이를 유지 관리하는 것이 필요합니다. Tuned Evaluators는 이러한 작업을 팀들이 즉시 연결하여 사용할 수 있는 제품으로 패키징했습니다.
Tuned Evaluators는 또한 좁게 정의된 평가 목표를 위해 사후 학습된 전문화된 모델을 통해 비용/품질 트레이드오프(cost/quality tradeoff) 문제를 해결하며, 적은 비용으로 최첨단 성능을 능가합니다. Tuned Evaluators를 실행하면 상당한 엔지니어링 시간과 추론 비용을 절약하면서 에이전트 개선을 위한 더 많은 신호를 얻게 됩니다.
Tuned Evaluators 작동 방식
- LangSmith 트레이싱 프로젝트에 Tuned Evaluator를 추가하고 저장합니다.
- LangSmith는 선택된 평가기의 요구 사항을 기반으로 적격한 트레이스 또는 스레드를 식별합니다.
- 전문화되고 LangChain이 관리하는 심사위원(judge)이 각 적격 트레이스 또는 스레드를 평가합니다.
- 결과와 그 설명은 피드백으로 평가된 트레이스 또는 스레드에 첨부됩니다.
- 팀들은 이 결과를 사용하여 트레이스를 조사하거나, 데이터셋에 유용한 예시를 추가하거나, 개선 워크플로우를 위한 평가(evals)를 구축합니다.
LangChain은 평가기 프롬프트를 작성하고, 테스트하고, 버전을 관리하며, 유지 관리합니다. 또한 심사위원 모델, 최첨단 모델 대비 벤치마킹, 제공업체 자격 증명(provider credentials), 그리고 추론 인프라까지 관리합니다.
개선 워크플로우에 Tuned Evaluator 결과 사용하기
팀들은 풍부하게 만들어진 트레이스를 자체 분석, 코딩 에이전트, CI, 수동 검토(human-review), 및 평가 워크플로우에서 사용할 수 있습니다. Tuned Evaluators는 다음을 지원합니다:
– 시스템 오류나 명시적인 사용자 평점 없이 실패를 발생시킨 사례를 찾아냅니다.
– 조사가 필요한 대화로 필터링하고 평가자의 설명과 원본 상호작용을 함께 검토할 수 있습니다.
– 플래그가 지정된 트레이스(traces)들을 비교하여 반복되는 실패 양식(failure modes)을 찾습니다.
– 태그가 지정된 트레이스를 평가 데이터셋에 추가하거나 모호한 대화를 인간의 검토를 위해 라우팅합니다.
– 이러한 예시들을 사용하여 에이전트의 변경 사항을 테스트하고 검증할 수 있습니다.
인지된 오류(Perceived Error)로 시작하기
인지된 오류는 에이전트가 실수했거나, 요청을 오해했거나, 상호작용을 잘못된 방향으로 이끈 증거를 포함하는 대화를 감지합니다.
그러한 증거는 사용자 수정, 반복적인 요청, 거부된 동작과 같은 명시적일 수 있습니다. 또한 모델은 모순되는 응답, 인정된 실수, 지속적인 오해, 또는 해결되지 않은 결과로부터 이를 추론할 수도 있습니다.
인지된 오류는 에이전트가 사용자의 요구를 충족시키고 있는지에 대한 유용한 대리 지표(proxy)입니다. 대부분의 사용자는 명시적인 평점을 제출하지 않기 때문에, 증거는 종종 대화 자체에서 추론되어야 합니다.
LangChain은 대화형 에이전트의 레이블링된 트레이스(traces)를 사용하여 전문 모델을 사전에 훈련했습니다. 이 모델은 벤치마크에서 모든 최첨단 모델(frontier model)보다 우수한 성능을 보였으며, 평가 비용을 82% 절감했습니다. 일부 초기 파트너 워크로드에서는 비용 절감이 최대 98%에 달했으며, 비용 편차는 스레드 구성에 따라 달라졌습니다.
Vanta가 초기 파트너로서 경험한 것은 또 다른 이점을 보여줍니다: 팀이 자체 비즈니스별 평가자(evaluators)를 개발하는 동안 즉시 품질 커버리지를 구축할 수 있다는 것입니다.
“이 기본 제공 평가자는 우리가 자체 비즈니스별 평가자를 구축하는 동안 첫날부터 실패 양식을 포착할 안전망을 제공했습니다. 이는 저희가 찾은 가장 빠른 운영화 방법입니다.” — Kevin Royer, Staff ML/AI Engineer, Vanta

적격성 및 시기(Eligibility and timing)
적격성 및 시기(Eligibility and timing)
스레드는 최소 두 쌍의 인간-AI 메시지 쌍을 포함하고 설정된 유휴 기간에 도달하면 Perceived Error 평가기로 사용 가능해집니다. 평가는 스레드가 사용 가능해진 후 12시간 이내에 완료됩니다.
이용 가능 여부 및 가격 책정(Availability and pricing)
Perceived Error Tuned Evaluator는 현재 미국 지역의 모든 Plus 및 Cloud Enterprise 플랜에서 이용 가능합니다. 각 성공적인 평가는 조정된 평가 비용이 발생합니다. 건너뛰거나 실패한 평가는 청구되지 않습니다. 일반 사용 및 결제 정보는 당사의 가격 책정 페이지를 참조하십시오.
시작하기(Get started)
LangSmith에 로그인하거나 가입하여 오늘 Perceived Error 평가기를 사용해 볼 수 있으며, 자세한 내용은 문서를 방문하십시오.
만약 저희가 구축해 주었으면 하는 Tuned Evaluator가 있다면, 귀하의 사용 사례에 대해 알려주십시오.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기