DCAS: 스캐폴드 전반에 걸친 계획(Planning) 내재화를 위한 CLI 에이전트 스캐폴딩 분리
요약
CLI 에이전트가 특정 훈련 환경(스캐폴드)에 과적합되어 다른 환경에서 성능이 저하되는 문제를 해결하기 위한 DCAS 프레임워크를 제안합니다. 계획(Planning)을 명시적·암묵적 구조로 구분하여 모델의 내재적 능력을 강화함으로써 스캐폴드 간 성능 격차를 해소합니다.
핵심 포인트
- 특정 스캐폴드 데이터로 미세 조정된 모델의 범용성 저하 문제 지적
- 계획(Planning)을 명시적 산출물과 암묵적 구조로 구분하여 정의
- DCAS를 통해 스캐폴드 수정 없이 모델과 환경 간의 API 트래픽 라우팅 가능
- 계획 인지적 궤적 수집을 통해 미학습 스캐폴드에서도 일관된 성능 향상 입증
CLI 기반 소프트웨어 공학 에이전트(software-engineering agents)는 빠르게 성숙해 왔으나, 개방형 생태계는 단일 훈련 환경으로 수렴되었습니다. 즉, 오픈 모델을 미세 조정(fine-tune)하는 데 사용되는 궤적 데이터셋(trajectory datasets)은 거의 독점적으로 OpenHands 환경에서 수집됩니다. 이 데이터로 미세 조정된 모델들은 OpenHands 환경에서는 높은 점수를 기록하지만, 훈련에 사용되지 않은 다른 스캐폴드(scaffold)에 배포될 경우 성능이 크게 저하됩니다. 훈련되지 않은 베이스 모델(base models)은 이러한 차이를 보이지 않는데, 이는 이러한 격차가 미세 조정으로 인해 유발되었으며 훈련 스캐폴드의 관습과 결부되어 있음을 나타냅니다.
본 논문은 부하를 견디는 스캐폴드 특유의 동작이 계획 구조(planning structure)라고 주장하며, 이를 두 가지 의미로 구분합니다. 첫째는 실행 전 생성되는 일급 객체(first-class artifact)로서의 명시적 계획(explicit planning)이며, 둘째는 에이전트 루프 전반에 걸쳐 실행을 형성하는 구조적 관습인 암묵적 계획(implicit planning)입니다. 이 가설에 따르면, 격차를 해소하기 위해서는 계획을 고정된 스캐폴드 산출물에서 학습된 모델 능력으로 이동시켜야 합니다.
우리는 Decoupling CLI Agent Scaffolding (DCAS)를 소개합니다. 이는 스캐폴드를 수정하지 않고도 임의의 CLI 스캐폴드와 임의의 백엔드 모델 간의 API 트래픽을 라우팅하는 백엔드 교체 인터셉션 계층(backend-substitution interception layer)으로, 스캐폴드 간 교차 평가 및 계획 인지적 궤적 수집(planning-aware trajectory collection)을 가능하게 합니다. DCAS를 사용하여 통제된 계획 소스 개입(plan-source intervention)을 수행한 결과, 계획의 품질이 매우 영향력 있는 구성 요소임을 확인하였으며, 그 이득은 우리가 관찰한 스캐폴드 간 성능 저하 폭을 상회했습니다. 단일 스캐폴드 하에서 DCAS로 수집된 소규모의 계획 인지적 궤적 데이터셋으로 미세 조정된 모델은 훈련에 사용되지 않은 다른 스캐폴드에서도 일관된 성능 향상을 보였으며, 계획의 두 가지 의미는 훈련 데이터에서 경험적으로 분리 가능함을 입증했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기