하네스(Harness)는 무엇을 구매하는가? 주로 토큰이다
요약
본 기사는 코딩 에이전트가 '하네스(Harness)'라는 컨텍스트 관리 시스템을 통해 언어 모델을 감싸는 방식을 설명합니다. 하네스는 시스템 프롬프트, 도구 세트 등을 통합하여 작동 환경을 만드는데, 실제 성능 테스트 결과 하네스를 변경하는 것만으로는 큰 점수 차이를 내기 어렵다는 것을 보여줍니다.
핵심 포인트
- 하네스는 모델을 감싸는 컨텍스트 관리 시스템이다.
- 실제 성능 측정에서 하네스 간의 점수 차이는 미미하다.
- 하네스의 비용 구조(청구서)가 가장 큰 변동 요인이다.
- 재실행 데이터 분석은 주장되는 이득보다 높은 해상도를 요구한다.
코딩 에이전트는 하네스로 감싸진 언어 모델입니다: 시스템 프롬프트, 도구 세트, 그리고 채팅 모델을 리포지토리 내부에서 작동할 수 있는 무언가로 변환시키는 컨텍스트 관리가 그것입니다. 프로덕션 하네스는 매일 릴리스를 배포하며, 공급업체들은 하네스 변경으로 인한 통과율(pass-rate) 증가분을 광고하고, 리더보드는 여러 하네스를 자유롭게 혼합합니다. 드물게 측정되는 것은 모델을 고정했을 때 하네스 자체가 점수를 얼마나 움직이는가입니다. 우리는 다섯 개의 모델을 세 가지 프로덕션 하네스인 Claude Code, mini-SWE-agent, 그리고 OpenCode를 사용하여 SWE-bench Verified에서 실행하고, 아무것도 바뀌지 않았지만 실행만 다시 했을 때 점수가 얼마나 움직이는지 보정하기 위해 동일한 구성을 재실행했습니다. 447개 태스크와 우리가 실행한 두 모델인 Claude Code와 mini-SWE-agent에 대해, 가장 무거운 하네스와 가장 가벼운 하네스는 다섯 포인트 이내로 동등합니다. 45개 태스크의 어려운 서브셋과 다섯 개의 모델에서, 하네스를 바꾸는 것은 동일한 하네스를 재실행하는 것만큼 많은 태스크를 뒤집어 놓습니다(각 경우 13%). 그리고 한 번 실행에서 하네스가 이긴 태스크가 다음번에도 이기는 태스크는 아닙니다. 노이즈를 제거하는 유일한 하네스 효과는 증가가 아니라 손실입니다: OpenCode는 대규모 풀에서 최대 9점까지 뒤처지며, 하나의 모델에서는 그 격차의 절반이 출력 제한으로 인해 짧게 끊긴 실행에 있습니다. 하네스가 결정하는 것은 청구서입니다. 동일한 모델, 동일한 태스크, 그리고 하나의 가격표로 볼 때, 태스크당 비용은 하네스마다 최대 3배까지 다릅니다. 이 격차는 각 하네스가 매 단계와 함께 보내는 시스템 프롬프트의 서문과 도구 스키마(tool schemas)의 프리앰블(preamble)에 의해 설정되며, 단계 수에 따라 조정됩니다; 단계당 증가분과 호출당 도구 출력은 훨씬 덜 다릅니다. 제공업체의 캐시된 입력 가격이 청구서를 조정하며 재배열하지는 않습니다. 재실행 데이터는 또한 하네스 비교가 필요로 하는 해상도를 제공합니다: 우리가 관찰한 불일치에서, 45개 태스크는 절반의 경우에만 13점 격차를 포착하고 80%의 파워로는 어떤 격차도 포착하지 못하며, 447개 태스크는 5점의 해상도를 해결하는데, 이는 여전히 많은 하네스 변경이 주장하는 이득보다 거칩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기