ACEM: 에이전트 기반 소프트웨어 엔지니어링을 위한 비용 추정 모델
요약
에이전트 기반 소프트웨어 엔지니어링 환경에서 발생하는 새로운 비용 구조를 분석하고 이를 추정하기 위한 ACEM 모델을 제안합니다. LLM 토큰 소비, 인간의 감독(HITL), 인프라 비용을 중심으로 기존의 소프트웨어 규모 측정 지표와 연결하는 프레임워크를 다룹니다.
핵심 포인트
- 에이전트 기반 개발의 3대 비용: LLM 토큰, HITL, 인프라
- ACEM 모델의 핵심 요소: 수정 계수(RF), 컨텍스트 계수(CF), HITL 강도 점수(HIS)
- 기존 프로젝트 규모 지표(Story Points 등)를 토큰 소비량으로 매핑 가능
- 비결정론적 에이전트 동작에 따른 비용 변동성 모델링
COCOMO II, 기능 점수 (Function Points), 스토리 포인트 (Story Points)와 같은 전통적인 소프트웨어 비용 추정 모델은 개발 노력이 주로 설계, 코딩 및 테스트 단계의 인간 노동에 의해 결정된다고 가정합니다. 자율적인 AI 에이전트가 상당한 구현 작업을 수행하고 인간은 계획, 사양 정의 및 검증에 집중하는 에이전트 기반 소프트웨어 엔지니어링 (Agentic software engineering)은 이러한 가설에 도전합니다. 새로운 비용 차원이 발생합니다: 에이전트 작업 전반에 걸친 대규모 언어 모델 (LLM) 토큰 소비, 인간 참여 (Human-in-the-Loop, HITL) 감독 노력, 그리고 에이전트 오케스트레이션 (orchestration) 및 도구 사용을 위한 인프라 비용입니다. 이러한 비용은 비결정론적 (nondeterministic)입니다. 즉, 동일한 작업이라도 서로 다른 토큰을 소비할 수 있고, 서로 다른 추론 경로를 따를 수 있으며, 다양한 수준의 인간 수정이 필요할 수 있는데, 이는 전통적인 개발 방식에서는 나타나지 않는 현상입니다. 표준 규모 측정 지표 (sizing metrics)와 이러한 비용 구조를 연결할 새로운 프레임워크가 필요합니다. 본 논문은 전체 에이전트 기반 개발 비용을 LLM, HITL, 인프라 비용이라는 세 가지 가산적 차원으로 분해하는 ACEM (Agentic Cost Estimation Model)을 제안합니다. ACEM은 에이전트 역학을 위해 세 가지 구성 요소를 도입합니다: 출력 거부 및 재시도로 인한 토큰 오버헤드를 모델링하는 수정 계수 (Revision Factor, RF), 컨텍스트가 축적됨에 따라 증가하는 토큰 소비를 포착하는 컨텍스트 계수 (Context Factor, CF), 그리고 4단계 감독 분류 체계인 HITL 강도 점수 (HITL Intensity Score, HIS)입니다. 또한, 유스케이스 포인트 (Use Case Points), 스토리 포인트 (Story Points), 기능 점수 (Function Points)를 추정된 토큰 소비량에 매핑함으로써, 조직이 기존의 프로젝트 범위 산정 데이터를 에이전트 기반 비용 예측에 재사용할 수 있도록 합니다. ACEM은 완전히 명시된 모델 구조와 보정 방법론으로 제시되며, 상수는 실증적 근거가 마련될 때까지 기호로 남겨둡니다. 초기 단계의 제안으로서, 본 논문은 연구 커뮤니티가 실제 프로젝트 데이터를 통해 모델을 보정, 테스트 및 확장할 것을 권장합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기