LangSmith Engine이 에이전트 문제 감지 성능을 2배 향상시키다
요약
LangSmith Engine은 에이전트 개발 수명 주기(ADLC) 전반에 걸쳐 트레이스를 분석하고 문제를 자동 감지하는 온 플랫폼 Deep Agent입니다. 최신 업데이트로 내부 벤치마크 성능이 두 배 이상 향상되었으며, 문제 진단부터 수정 사항 제안까지 엔지니어링 작업을 가속화합니다. 이는 에이전트 개발 과정에서 발생하는 복잡한 오류 식별 및 근본 원인 분석을 자동화하여 효율성을 극대화합니다.
핵심 포인트
- 에이전트 트레이스 분석 성능이 내부 벤치마크에서 2배 이상 향상됨.
- 문제 진단, 수정 사항 제안, 회귀 모니터링 등 ADLC 전반을 지원함.
- Slack 알림 및 Linear 티켓 연동 등 작업 흐름 통합 기능을 제공함.
- 비용 유연성을 높여 사용자가 문제 식별에 집중할 수 있도록 개선됨.
주요 요약
Engine의 성능이 2배 이상 향상: Engine은 내부 벤치마크에서 에이전트 문제를 식별하는 성능이 두 배 이상이며, 업계 표준 벤치마크에서는 문제 해결 능력이 25% 더 뛰어납니다.
작업 흐름에 통합된 Engine: Engine 내에서 새로운 이슈에 대한 Slack 알림을 받거나 Linear에 티켓을 열고, 자체 호스팅 LangSmith 배포판에서도 Engine을 사용할 수 있습니다.
더 큰 비용 유연성을 제공하는 Engine: 분석(Analysis) 모드가 축소되어 사용자가 에이전트 문제를 식별하기 위해 여전히 Engine을 사용하면서도 비용에 대한 더 많은 통제권을 갖게 되었습니다.
에이전트를 개선하는 것은 어려운 작업입니다. 프로덕션 에이전트는 수백만 개의 트레이스를 생성할 수 있으며, 이 모든 것을 스캔하여 오류를 식별하고 근본 원인을 파악하며 각 문제에 대한 수정 사항을 작성하는 것은 그 규모에서는 비현실적입니다. 이것이 바로 우리가 LangSmith Engine을 구축한 이유입니다. 이는 프로덕션 트레이스를 분석하고, 문제를 찾고, 해결책을 제안하며, 회귀(regression)를 모니터링하는 온 플랫폼 에이전트입니다.
최신 릴리스로써, Engine은 에이전트 트레이스에서 영향력 있는 문제점을 식별하는 내부 벤치마크 성능이 두 배 이상 향상되었으며, 프롬프트와 코드에 대한 수정 사항을 작성하는 업계 표준 벤치마크에서는 25% 더 뛰어납니다.
LangSmith Engine의 기능
Engine은 에이전트 개발 수명 주기(ADLC) 전반에 걸쳐 수동 프로세스를 자동화합니다. 이는 LangSmith에서 트레이스를 분석하여 엔지니어가 에이전트 실패부터 수정까지 빠르게 이동할 수 있도록 돕는 온 플랫폼 Deep Agent입니다.
Engine은 에이전트 트레이스에서 문제를 식별하고, 관련 발생 사례를 그룹화하며, 이를 해결하는 데 필요한 핵심 아티팩트를 제공합니다:
증거가 포함된 진단: 문제가 나타난 에이전트 실행 기록, 사건 타임라인(재발 포함), 그리고 근본 원인
제안된 수정 사항: 검토를 위한 프롬프트 또는 코드 변경 및 배포 준비가 된 PR(Pull Request)
참조 데이터 예시 (Ground truth examples): 실패한 실행 기록을 데이터셋 예시 형식으로 구성하여, 수정 사항이 실제 환경에 적용되기 전에 오프라인에서 검증될 수 있도록 함
지속적인 모니터링: 회귀를 포착하고 해결하는 데 도움을 주는 지속적이고 이슈별 모니터링
실제 환경에서는 이를 통해 LangSmith를 사용하여 ADLC(Agent Development Lifecycle) 전반을 거칠 수 있으며, Engine이 각 단계를 가속화하는 데 도움을 줍니다.

Engine 개선 사항
저희는 Engine을 5월에 출시했습니다. 그 이후로 Engine은 6천만 건 이상의 트레이스(traces)를 스캔하여 고객사 에이전트에서 2만 개가 넘는 이슈를 발견했으며, 이를 통해 수만 시간의 엔지니어링 작업을 절약해 주었습니다.
저희는 Engine의 성능을 지속적으로 개선하고 있으며, 이는 Engine 워크플로우의 다양한 구성 요소를 평가하는 여러 내부 벤치마크를 기준으로 측정됩니다. 여기에는 트레이스에서 이슈를 식별하고 그룹화하는 데 얼마나 좋은지 평가하는 IssueBench와, Engine이 제안한 수정 사항의 효과를 평가하는 또 다른 벤치마크가 포함됩니다.
5월 출시 이후로 저희는 Engine의 성능을 상당히 향상시켰습니다. Engine은 IssueBench에서 두 배 이상 높은 점수를 기록하며, Terminal-Bench와 같은 공개 벤치마크에서는 수정 사항이 25% 더 좋은 점수를 받았습니다. 이는 Engine이 이제 다음을 수행한다는 것을 의미합니다:
- 신호가 더 높은 이슈를 표면화하고(Surfaces higher-signal issues)
- 에이전트 실행 전반에 걸쳐 더 많은 이슈를 감지하며(Detects more issues across agent runs)
- 더욱 효과적인 수정 사항을 제안한다는 것입니다(And proposes more effective fixes).
이러한 개선점들은 사용자분들이 가장 영향력 있는 이슈에 집중하고, 이전보다 훨씬 빠르게 이를 해결하는 데 도움을 줍니다.
Engine의 다른 새로운 기능들
저희는 또한 고객들이 작업 흐름 내에서 Engine을 더 효과적으로 사용하고, Engine이 식별한 이슈들을 더 잘 분류(triage)할 수 있도록 돕는 새로운 기능을 출시하고 있습니다.
자체 호스팅 배포 환경에서의 이용 가능성: 이제 Engine은 자체 호스팅 고객에게도 제공되어, 엔터프라이즈 보안 및 규정 준수 요구 사항을 충족하면서 에이전트 개선 속도를 높일 수 있습니다. Engine의 오케스트레이션(orchestration) 실행은 고객의 VPC 내부에서 이루어지며, 목적에 맞게 훈련된 모델로 구동되는 관리형 추론(managed inference)을 위해 저희가 관리하는 데이터 보존 제로 서비스인 LangSmith Intelligence에 요청을 전송합니다.
생태계 통합: Engine은 이제 팀들이 프로덕션 에이전트의 이슈를 관리하기 위해 이미 사용하고 있는 도구 및 워크플로우에 더 잘 통합됩니다.
Slack: Engine이 감지한 문제를 Slack을 통해 에이전트 엔지니어들에게 알림으로써 신속하게 조사할 수 있도록 합니다.Linear: Engine이 감지한 문제에 대해 Linear 이슈를 자동으로 생성하여, 나머지 엔지니어링 백로그와 함께 우선순위를 지정하고 해결 과정을 추적하기 쉽게 만듭니다. 분석 감소(Reduced Analysis): 분석 감소 모드를 사용하면 팀이 더 적은 트레이스를 스캔할 수 있어, 비용에 민감한 사용자도 Engine을 사용하여 문제를 찾으면서 비용을 절감하는 데 도움이 됩니다. 이슈 위생 관리(Issue Hygiene): Engine은 에이전트 트레이스에서 나타나지 않아 오래된 이슈를 자동으로 닫아, 엔지니어들이 활발하고 영향력 있는 문제 해결 노력에 집중할 수 있도록 합니다. 추적과의 강화된 통합(Stronger Integration with Tracing): Engine은 특정 문제가 발생한 LangSmith 트레이스의 정확한 위치를 알려주어, 사용자가 해결책을 진행하기 전에 Engine의 발견 사항을 검증하는 데 도움을 줍니다. ## 프로덕션 환경에서의 모습 고객들은 이미 Engine을 사용하여 프로덕션 에이전트를 모니터링하고, 반복되는 실패 사례를 파악하며, 감지부터 분류(triage)까지 더 빠르게 움직이고 있습니다. “Engine은 관측 가능성(observability)과 분류 작업을 한 곳에 가져옵니다. 저는 이 엔진의 근본 원인 진단 품질과 초안으로 작성된 제안 수정 사항에 놀랐습니다. 이는 저희의 탐지 시간(time-to-detection)과 분류 시간(time-to-triage)을 극적으로 줄여주었습니다. 즉, 트레이스를 뒤지는 데 쓰는 시간이 줄고, 오작동하는 동작에서 배포되는 수정사항까지의 경로가 훨씬 짧아졌다는 의미입니다.” — Nancy Jin, AI Engineer @ Campfire ## Engine의 다음 방향성 저희는 대규모로 수동으로 처리하기 가장 어려운 부분이 바로 문제 발견 및 진단이기 때문에 Engine을 구축했습니다. 우리의 다음 초점은 검증(verification)입니다: 자동화된 검증(Automated Verification): Engine은 제안하는 수정 사항들을 사용자의 데이터셋에 대해 실행하고, 그 결과를 해당 이슈와 함께 보고합니다. 따라서 변경 사항이 작동하는지 결정하기 전에 확인할 수 있습니다.
Engine 생성 데이터셋 (Engine-Generated Datasets): Engine은 에이전트의 추적(traces) 및 프롬프트에서 평가 데이터셋을 생성하여, 사용자가 직접 데이터셋을 구축하는 부담 없이 에이전트 동작을 빠르게 테스트할 수 있도록 돕습니다. 또한 기존에 추적이 없는 에이전트의 데이터셋 생성도 지원합니다.
시작하기 (Getting started)
Engine은 모든 LangSmith Plus 및 Enterprise 플랜에서 SaaS와 자체 호스팅(self-hosted) 배포를 통해 이용 가능합니다. 가격 세부 정보는 여기에서 확인할 수 있습니다.
Plus 플랜을 사용 중이라면, LangSmith에서 몇 번의 클릭만으로 Engine을 활성화할 수 있습니다.
Enterprise 플랜을 사용 중이라면, 계정 팀에 문의하여 시작할 수 있습니다.
LangSmith를 처음 접하시나요? 오늘 가입하거나 영업팀에 연락하여 시작해 보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 LangChain Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기