SkillsVote: 수집, 추천에서 진화에 이르는 에이전트 기술의 생애주기 거버넌스
요약
SkillsVote는 LLM 에이전트의 경험 궤적을 체계적인 '에이전트 기술(Agent Skills)'로 관리하기 위한 생애주기 거버넌스 프레임워크입니다. 이 시스템은 기술의 수집, 추천, 검증 및 진화 과정을 구조화하여 노이즈가 많은 데이터를 정제하고, 성공적인 기술만을 라이브러리에 업데이트함으로써 에이전트의 성능을 지속적으로 향상시킵니다. 실험 결과, 모델 업데이트 없이도 외부 기술 라이브러리 관리를 통해 Terminal-Bench 2.0 및 SWE-Bench Pro 성능을 유의미하게 개선했습니다.
핵심 포인트
- 에이전트의 실행 궤적을 실행 가능한 스크립트와 비실행형 가이드가 결합된 '경험 스키마'로 구조화함
- 에이전트 방식의 라이브러리 검색을 통해 실행 전 적절한 지침적 기술 컨텍스트를 제공함
- 실행 후 궤적을 하위 태스크로 분해하고 기여도를 할당하여 증거 기반의 업데이트를 수행함
- 모델 자체를 재학습시키지 않고도 관리된 외부 기술 라이브러리만으로 에이전트 성능을 향상시킬 수 있음
장기적(Long-horizon) LLM 에이전트들은 재사용 가능한 경험이 될 수 있는 흔적을 남기지만, 가공되지 않은 궤적(raw trajectories)은 노이즈가 많고 관리하기 어렵습니다. 우리는 에이전트 기술(Agent Skills)을 실행 가능한 스크립트와 절차에 대한 비실행형 가이드(non-executable guidance)를 결합한 경험 스키마(experience schema)로 취급합니다. 그러나 개방형 기술 생태계에는 중복되고, 불균형하며, 환경에 민감한 산출물들이 포함되어 있으며, 무분별한 업데이트는 향후의 컨텍스트(context)를 오염시킬 수 있습니다. 우리는 수집과 추천에서 진화에 이르는 에이전트 기술(Agent Skills)을 위한 생애주기 거버넌스(lifecycle-governance) 프레임워크인 SkillsVote를 제시합니다. SkillsVote는 환경 요구사항, 품질 및 검증 가능성을 위해 백만 단위 규모의 오픈 소스 코퍼스(corpus)를 프로파일링한 다음, 검증 가능한 기술을 위한 태스크(tasks)를 합성합니다. 실행 전, SkillsVote는 구조화된 기술 라이브러리(skill library)에 대해 에이전트 방식의 라이브러리 검색(agentic library search)을 수행하여 지침적 기술 컨텍스트(instructional skill context)를 노출합니다. 실행 후에는 궤적(trajectories)을 기술과 연결된 하위 태스크(subtasks)로 분해하고, 결과를 기술 사용, 에이전트 탐색, 환경 및 결과 신호(result signals)의 기여도로 할당하며, 증거 기반 게이트(evidence-gated) 업데이트를 통해 성공적인 재사용 가능한 발견만을 수용합니다. 평가 결과, 오프라인 진화(offline evolution)는 Terminal-Bench 2.0에서 GPT-5.2의 성능을 최대 7.9 pp 향상시켰으며, 온라인 진화(online evolution)는 SWE-Bench Pro를 최대 2.6 pp 향상시켰습니다. 전반적으로, 시스템이 노출, 기여(credit), 보존을 제어할 때 관리되는 외부 기술 라이브러리는 모델 업데이트 없이도 고정된(frozen) 에이전트의 성능을 향상시킬 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기