생산 추적 기록에서 에이전트 스킬 마이닝
요약
본 연구는 실행 추적 데이터로부터 에이전트 스킬을 추출하는 '스킬 마이닝'의 효과를 분석했습니다. 샘플링 방식, 성공/실패 정보 접근성, 그리고 스킬 형태(워크플로우 vs 온톨로지)가 다운스트림 작업 성능에 미치는 영향을 비교 연구했습니다. 다양한 조합의 증거와 형태를 평가한 결과, 최적의 방법론은 특정 기업 도메인과 작업 구조 요구사항에 따라 달라진다는 것을 발견했습니다.
핵심 포인트
- 스킬 마이닝 파이프라인을 통해 에이전트 스킬 추출 가능
- 마이닝 증거(성공/실패 정보)와 스킬 형태가 성능에 영향
- 도메인별로 최적의 접근 방식이 다르므로 메타-스킬 조정 필요
절차적 지침을 기록하는 에이전트 스킬은 수동으로 큐레이션되기보다는 실행 추적(execution traces)으로부터 점점 더 많이 추출되고 있습니다. 스킬 마이닝 파이프라인은 종종 알려진 작업 결과나 피드백을 사용하여 스킬 구축을 안내합니다. 실제 환경에서는 특정 실행이 성공했는지 여부에 대한 신뢰할 수 있는 정보가 없을 수도 있습니다. 본 연구는 실행 추적의 샘플링, 성공 또는 실패 정보에 대한 접근성, 그리고 마이닝된 스킬의 형태가 다운스트림 작업 성능에 어떻게 영향을 미치는지 연구합니다. 마이닝 파이프라인을 고정하고, 우리는 여섯 가지 조합의 마이닝 증거(mining evidence)와 스킬 형태를 비교했습니다. 마이닝 증거는 세 가지 수준을 가집니다: 성공적인 궤적만 사용하거나, 결과 레이블과 함께 성공 및 실패 사례를 사용하거나, 또는 레이블이 보류된 동일한 혼합을 사용하는 것입니다. 스킬 형태에는 두 가지 유형이 있습니다: 순서화된 워크플로우 계획(ordered workflow plan) 또는 개체, 상태, 정책에 대한 선언적 온톨로지(declarative ontology). 우리는 ThinkingBox-Bench와 APEX-Agents라는 두 개의 기업 벤치마크에서 마이닝된 스킬을 평가했습니다. 작업 수준의 쌍별 차이 분석 결과, 다양한 마이닝 증거 및 스킬 형태 구성의 이점은 기업 도메인에 따라 달라진다는 것을 보여줍니다. ThinkingBox-Bench에서는 워크플로우가 온톨로지보다 1.7 pp 더 높은 점수를 기록했으며, Goldilocks는 성공 전용 증거 유형보다 2.4 pp 높았고, 결과 없이 학습된 스킬을 블라인드 시뮬레이션하는 Goldilocks는 3.1 pp 낮았습니다. APEX-Agents에서는 온톨로지에 대한 중간 정도의 선호도가 나타났으며, 증거 체제 간에는 명확한 선호도가 없었습니다. 각 도메인 내에서 작업 구조 관련 제약 조건이 마이닝된 스킬의 불균등한 성능을 유도합니다. 이러한 발견은 모든 상황에 맞는 접근 방식을 채택하기보다는, 타겟 작업의 요구 사항에 맞춰 메타-스킬(meta-skills)을 조정할 필요성을 시사합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기