지속 가능한 에이전트 개발을 위한 체계적인 비교: 개발자 워크플로우를 위한 에이전틱 LLM 분석
요약
본 논문은 코드 생성, 취약점 탐지 등 5가지 소프트웨어 공학 작업을 아우르는 에이전틱 LLM 시스템을 포괄적으로 분석했습니다. 다양한 LLM 구성과 하드웨어 플랫폼을 비교한 결과, 에이전트 복잡성 증가가 에너지 소비와 지연 시간을 크게 늘리지만, 정확도 향상은 제한적임을 밝혔습니다.
핵심 포인트
- 에이전틱 시스템은 높은 컴퓨팅 및 환경 비용을 초래합니다.
- 다중 에이전트는 비에이전틱 대비 에너지 소모와 지연 시간이 증가합니다.
- 정확도 개선 효과는 작업별로 다르며, 경량 구성이 파레토 최적점을 지배합니다.
- 지속 가능하고 작업 인지적인 LLM 개발 도구 설계가 필요합니다.
대규모 언어 모델(LLMs)은 코드 생성, 기술 부채 식별, 코드 취약점 탐지, 로그 파싱 및 로그 분석 등 다섯 가지 소프트웨어 공학 작업에 걸쳐 에이전트가 여러 에이전트를 조정하는 에이전틱 시스템을 포함하여 점점 더 많이 사용되고 있지만, 높은 컴퓨팅 및 환경 비용을 초래합니다. 본 논문에서는 이 다섯 가지 소프트웨어 공학 작업을 아우르는 에이전틱 LLM 시스템에 대한 포괄적인 실증 연구를 제시합니다. 각 작업에 대해 우리는 비(非)에이전틱 단일 쿼리 기준선부터 다중 에이전트 워크플로우까지 범위의 LLM 구성을 비교하며, 여섯 개의 오픈 웨이트 LLM, 두 가지 프롬프트 전략, 그리고 세 가지 하드웨어 플랫폼을 사용합니다. 우리는 정확도, 추론 지연 시간(inference latency), 에너지 소비 측면에서 각 구성을 평가합니다. 우리의 결과는 에이전틱 복잡성과 에너지 효율성 사이에 상당한 상충 관계가 있음을 보여줍니다: 다중 에이전트 설계는 평균적으로 비에이전틱 기준선보다 6.36$ imes$ 더 많은 에너지를 소비하고 6.07$ imes$ 더 오래 실행되며, 개별 작업-하드웨어 쌍의 경우 최대 160$ imes$까지 최악의 경우 지연 시간이 발생합니다. 추가적인 에이전트로부터 얻는 정확도 향상은 제한적이며 작업에 따라 다릅니다: 다중 에이전트는 평균 취약점 탐지 정확도를 개선하지만, 경량의 비에이전틱 및 단일 에이전트 구성이 여전히 파레토 전면(Pareto front)을 지배하며, 이는 66개의 파레토 최적 구성 중 59개를 차지합니다. 모델과 프롬프트 선택은 글로벌 기본값이라기보다는 작업별 레버리지 역할을 하며, 그 효과적인 방향은 작업마다 다릅니다. 우리는 이러한 발견들을 지속 가능하고 작업 인지적인 LLM 기반 개발 도구의 설계 지침으로 변환합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기