모듈형 실행 가능한 Dev-Primitives를 통한 소프트웨어 엔지니어링을 위한 하네스 설계
요약
본 논문은 LLM 기반 에이전트가 장기적인 소프트웨어 엔지니어링 작업 흐름에서 겪는 컨텍스트 폭발 및 의미론적 표류 문제를 해결하기 위한 새로운 프레임워크를 제안합니다. 핵심 개념인 Dev-Primitives는 저장소 아티팩트를 능동적인 참여자로 변환하여 LLM에 에이전트 네이티브 인터페이스를 부여합니다. 이를 기반으로 한 HERMES 프레임워크는 모듈형 하네스 설계를 통해 성능 향상과 추론 비용 절감을 입증했습니다.
핵심 포인트
- Dev-Primitives: 저장소 아티팩트를 능동적 참여자로 변환하는 모듈형 추상화.
- HERMES: Dev-Primitives를 활용한 소프트웨어 엔지니어링 하네스 설계 프레임워크.
- 장기 작업 흐름에서 컨텍스트 폭발 및 의미론적 표류 문제 해결에 기여.
- GPT-5.6급 성능을 유지하면서도 추론 비용을 절감하는 효율성을 입증함.
터미널 접근 권한을 갖춘 대규모 언어 모델(LLMs)은 소프트웨어 엔지니어링 작업을 자동화하는 데 강력한 능력을 보여주었습니다. 하지만 기존 에이전트들은 프로그램 상태를 소스 파일, 설정, 테스트, 종속성 및 런타임 동작 전반에 걸쳐 반복적으로 재구성해야 하는 장기 작업 흐름(long-horizon workflows)에서 여전히 취약합니다. 이는 점점 길어지는 상호작용 기록, 컨텍스트 폭발(context explosion), 그리고 의미론적 표류(semantic drift)를 초래합니다. 대규모 저장소는 작업 관련 구성 요소의 식별을 더욱 복잡하게 만듭니다. 이러한 문제들을 해결하기 위해, 우리는 소프트웨어 엔지니어링에서 저장소 구성 요소를 수동적인 소프트웨어 아티팩트에서 능동적인 참여자로 변환하는 모듈형 실행 가능한 추상화인 extbf{Dev-Primitives} ( extit{Development Primitives})를 소개합니다. 각 Dev-Primitive는 저장소 아티팩트를 거주하는 LLM과 쌍으로 묶어, 해당 아티팩트에 자체 구현 및 종속성에 기반한 에이전트 네이티브 인터페이스를 부여하며, 이를 통해 자연어 추론, 구성 요소 간 통신, 그리고 국지적인 자가 수정(localized self-modification)을 가능하게 합니다. Dev-Primitives를 기반으로, 우리는 모듈형 실행 가능한 Dev-Primitives를 통한 소프트웨어 엔지니어링 하네스 설계 프레임워크인 extbf{HERMES}를 제안합니다. HERMES는 종속성 인식 동적 활성화 메커니즘과 실행 증거를 수정해야 할 구성 요소로 매핑하는 버그 진단 메커니즘을 통해 이러한 프리미티브들을 저장소 규모에서 구현합니다. 네 가지 소프트웨어 엔지니어링 벤치마크에 대한 광범위한 실험 결과, HERMES는 평균적으로 일치하는 기준선 하네스 대비 12.4%의 성능 향상을 보여줍니다. 더욱이, 강력한 활성화 및 진단 모델과 결합했을 때, HERMES는 Qwen3-8B Dev-Primitives를 사용했음에도 불구하고 네 가지 벤치마크 모두에서 균질한 GPT-5.6 Sol 구성 대비 4.5% 이내의 성능을 유지하며, Terminal-Bench 4.0에서는 추론 비용을 26.2% 절감하는 것으로 나타나, 소프트웨어 엔지니어링 에이전트에서 하네스 설계의 중요성을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기