너무 많은 스킬: 코-설치된 스킬들이 코딩 에이전트에서 충돌하는 방식
요약
코딩 에이전트의 스킬(skill)들이 여러 출처에서 코-설치되면서 유사한 작업을 수행하는 경우 충돌이 발생할 수 있습니다. 본 연구는 이러한 충돌 현상을 실증적으로 분석하여, 벤치마크가 단순히 작업 완료 여부만 확인해서는 안 되며, 독점적인 핵심 기능의 손실을 점수화해야 함을 제안합니다.
핵심 포인트
- 설치된 스킬의 약 4분의 1이 유사한 스킬과 함께 코-설치되어 충돌 위험이 높습니다.
- 유사 스킬로 시작하는 실행은 설치된 스킬만이 가진 독점적 핵심 기능을 상당 부분 잃게 됩니다.
- 충돌은 첫 번째 스킬 읽기 시점에서 결정되므로, 이 사전 도구 후크(pre-tool hook)를 보호해야 합니다.
- 벤치마크는 작업 완료 여부 외에 독점적인 핵심 기능의 충실도를 점수화해야 합니다.
코딩 에이전트는 에이전트 스킬로 확장되는데, 이 디렉터리에는 SKILL.md 파일이 있어 모델에게 언제 어떻게 작업을 수행할지 알려줍니다. 스킬은 독립적인 출처(팀, 개발자, 플러그인, 복사된 컬렉션)에서 오기 때문에, 설치된 스킬이 동일한 작업을 하는 유사한 스킬과 함께 코-설치될 수 있으며, 모델은 이름과 설명만으로 그중 하나를 선택합니다. 충돌이 발생하면, 설치된 스킬은 핵심 기능(예: git을 건드리는 것이 금지됨)을 잃게 되는데, 이는 대신 실행되는 유사한 스킬이나 변경된 작업 방식 때문입니다. 이 경우에도 작업은 여전히 통과하므로, 오직 작업 완료만을 확인하는 벤치마크는 이러한 사례를 놓칩니다. 우리는 이러한 충돌에 대한 최초의 실증 연구를 제시합니다. 20,947개의 리포지토리 스냅샷에서, 우리는 822,109쌍의 후보 유사-스킬 쌍을 채굴했고, LLM에게 3,754개로 계층화된 샘플을 판단하게 했으며, 확인된 312쌍을 세 가지 모델에 걸쳐 실행했습니다 (6,368회 실행, 169,294개의 도구 호출, 542 에이전트-시간). 우리는 다섯 가지 발견 사항을 보고합니다. (1) 충돌하기 쉬운 스킬은 흔하며: 설치된 스킬 중 거의 4분의 1이 동일한 작업을 하는 스킬과 함께 코-설치되며, 판단된 스킬의 37%가 복사된 컬렉션 안에 존재합니다. (2) 이러한 쌍의 대부분은 규범적(normative) 스킬을 포함하고 있으며, 그 다음으로 역량 기반(capability) 스킬이 관련됩니다. (3) 작업 완료도를 낮추지 않으면서도, 유사한 스킬은 5번 중 1번 실행에서 설치된 스킬을 대체하며, 유사한 스킬로 시작하는 실행은 오직 설치된 스킬만이 수행할 수 있는 독점적인 핵심 기능의 3분의 1 이상을 잃게 됩니다. (4) 설치 위치가 어떤 스킬이 실행될지 결정하며, 목록 순서는 거의 중요하지 않고, 최종 응답에서 사용된 스킬 이름을 언급하는 경우는 단 0.9%에 불과합니다. (5) 충돌은 첫 번째 스킬 읽기 시점에서 결정되며, 거의 항상 파일이 변경되기 전에 발생하고, 이 읽기 시점에서의 사전 도구 후크(pre-tool hook)는 독점적인 핵심 기능의 충실도를 설치된 스킬로 먼저 시작하는 실행 수준으로 복원합니다. 따라서 벤치마크는 독점적인 핵심 기능을 점수화해야 하며, 플랫폼은 첫 번째 읽기를 보호하고 어떤 스킬이 실행되었는지 보여주어야 합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기