할 수 없는 것을 제안하지 마세요: 대규모 LLM 기술 선택을 위한 결정론적 실행 가능성 게이팅 (Deterministic
요약
Wix의 고객 케어 에이전트 Helpmate에 적용된 3단계 기술 선택 파이프라인을 소개합니다. 의미론적 매칭 후 결정론적 실행 가능성 게이트를 도입하여, 계정 상태에 따라 실행 불가능한 기술을 사전에 제거함으로써 컨텍스트 비용을 90.5% 절감했습니다.
핵심 포인트
- 의미론적 매칭과 결정론적 게이팅을 결합한 3단계 파이프라인 제시
- 실행 불가능한 후보를 사전에 제거하여 컨텍스트 토큰 사용량 90.5% 감소
- 게이트 도입을 통해 모델이 실행 불가능한 기술을 선택하는 오류 방지
- 대규모 기술 라이브러리를 가진 프로덕션 에이전트의 효율성 최적화
대규모 기술 라이브러리(skill libraries)에서 선택을 수행하는 프로덕션 LLM 에이전트들은 의미론적 관련성(semantic relevance)만으로는 해결할 수 없는 한계에 직면합니다. 즉, 특정 기술이 사용자의 주제와 일치하더라도 현재 계정 상태(account state)에서 실행이 불가능할 수 있습니다. 우리는 Wix의 고객 케어 어시스턴트인 Helpmate에 배포된 3단계 선택 파이프라인을 제시합니다. 첫째, 리콜 중심의 의미론적 매처(semantic matcher)는 계정 상태를 확인하지 않고 10개의 기술 도메인 패밀리와 관련된 메시지를 식별합니다. 둘째, 결정론적 실행 가능성 게이트(deterministic executability gate)는 내부의 중단 조건(hard-stop conditions)이 충족되는 후보들을 제거합니다. 게이트와 기술이 동일한 종료 서술어(exit predicates)를 평가하기 때문에, 서술어 일치성(predicate parity)이 유지되고 두 확인 절차가 모두 최신의 권위 있는 상태(authoritative state)를 관찰한다면, 차단된 모든 후보는 동일한 계정 상태 하에서 완료할 수 없었을 것입니다. 마지막으로, LLM은 남은 후보 중 하나를 호출할지 여부를 결정합니다. 267.6K개의 대화에 걸친 756.6K개의 사용자 메시지에 대한 출시 후 프로덕션 분석 결과, 의미론적 매칭(semantic matching)은 174,927개의 메시지(23.1%)를 유지했습니다. 이 매칭된 스트림 내에서, 게이트는 1,749,270개의 기술-메시지 쌍 중 1,039,462개(59.4%)를 제거하여 2억 2,880만 개의 기술 설명 토큰(skill-description tokens)을 절약했습니다. 이는 의미론적 매칭 이후의 기술 설명 점유율(footprint)의 59.1%에 해당합니다. 결과적으로 의미론적 매칭과 실행 가능성 게이팅을 결합하여, 모든 메시지에 10개의 기술을 모두 노출했을 때와 비교해 기술 설명 컨텍스트(skill-description context)를 90.5% 감소시켰습니다. 이러한 가지치기(pruning)가 컨텍스트 크기뿐만 아니라 모델의 행동에 영향을 미치는지 테스트하기 위해, 우리는 1,000개의 대화로 구성된 리스크가 강화된 코호트(risk-enriched cohort)를 대상으로 10개의 기술을 모두 노출하여 재실행했습니다. 모델은 78개의 대화(7.8%)에서 프로덕션에서 차단된 기술을 선택했습니다. 이 반사실적 결과(counterfactual result)는 결정론적 게이팅이 실행 불가능한 후보가 모델 선택에 영향을 미치는 것을 방지한다는 것을 보여주며, 다만 하위 도구 실행(downstream tool execution)이나 고객 결과(customer-outcome) 효과를 주장하는 것은 아닙니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기