HarnessOpt-Bench: 하네스 최적화(Harness Optimization)에서의 LLM 성능 평가
요약
LLM 에이전트 시스템의 성능을 결정하는 프롬프트, 도구, 제어 흐름 등의 '하네스'를 최적화하는 능력을 평가하기 위한 새로운 벤치마크인 HarnessOpt-Bench를 제안합니다. 실험을 통해 하네스 최적화가 모델의 차별화된 능력이자 개선 가능성이 큰 영역임을 입증했습니다.
핵심 포인트
- 하네스 최적화는 모델 가중치 외의 구성 요소를 개선하는 핵심 과정임
- HarnessOpt-Bench는 엔드 투 엔드 하네스 최적화 평가를 위한 벤치마크임
- 최첨단 LLM의 하네스 최적화 능력을 다양한 태스크에서 검증함
- 하네스 최적화는 측정 가능하며 모델 간 성능 차이를 유발하는 능력임
LLM(Large Language Models)이 에이전트 시스템(agentic systems) 내에 점점 더 많이 배치됨에 따라, 모델의 능력은 모델 가중치뿐만 아니라 하네스(harness), 즉 모델을 둘러싼 프롬프트(prompts), 도구(tools), 제어 흐름(control flow), 메모리(memory) 및 오케스트레이션(orchestration) 코드에 의해서도 결정됩니다. 이는 자동화된 하네스 최적화(harness optimization) — AI 시스템에 의해 하네스를 반복적이고 평가 가이드에 따라 개선하는 과정 — 를 AI 시스템을 개선하는 중요한 경로인 동시에, AI 시스템 자체가 갖추어야 할 까다로운 능력으로 만듭니다. 그러나 커뮤니티에는 최첨단 LLM이 이 작업에서 얼마나 잘 수행하는지를 측정하기 위한 공통 프로토콜이 부족합니다. 우리는 비용이 많이 들고 확률적인(stochastic) 평가 환경에서의 엔드 투 엔드(end-to-end) 하네스 최적화를 위한 벤치마크인 HarnessOpt-Bench를 소개합니다. 코딩 하네스와 결합된 LLM인 옵티마이저(optimizer)는 타겟 에이전트의 시드 하네스(seed harness), 등급이 매겨진 평가 피드백, 그리고 고정된 타겟 평가 예산을 전달받습니다. 옵티마이저는 하네스를 편집하고 최종 후보를 지명하며, 이 후보는 검색 과정 내내 접근할 수 없는 별도의 테스트 파티션(test partition)에서 시드 대비 정규화된 이득(normalized gain)을 통해 점수가 매겨집니다. 신뢰할 수 있는 실행 환경(trusted execution environment)은 평가 경계를 강제하고, 타겟 에이전트의 리소스 사용량을 측정하며, 감사를 위해 후보 버전을 보존합니다. 우리는 5개의 최첨단 LLM을 옵티마이저로 사용하여, 공유 코딩 하네스 환경과 각자의 네이티브 하네스(native harnesses) 환경 모두에서 4개의 다운스트림 태스크(downstream tasks)에 대해 111회의 점수 산정 실행을 거쳐 평가했습니다. 실험 결과, 옵티마이저 모델은 그들이 작동하는 코딩 하네스보다 더 뚜렷하게 구분되었으며, 네이티브 하네스가 일관되게 우월하지는 않았고, 이득은 태스크와 시드 체제(seed regimes)에 따라 크게 달라졌습니다. 이러한 결과는 하네스 최적화가 측정 가능하고 차별화된 능력이며, 개선할 여지가 매우 크다는 것을 입증합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기