연구자들이 3가지 오픈소스 에이전트 하네스(Goose, OpenCode, OpenHands-SDK)를 사용하여 50개의
요약
연구자들이 3가지 오픈소스 에이전트 하네스(Goose, OpenCode, OpenHands-SDK)를 사용하여 50개의 코딩 과제에 테스트했습니다. 이 과정에서 하네스는 해결된 과제당 사용 토큰 수를 최대 40배까지 변화시켰으나, 모델의 합격률은 미미한 변화만 보였습니다. 또한, AI 에이전트가 생성한 작업물 인계(handoff) 시 비용 및 기록 관리 문제가 발생할 수 있음을 지적합니다.
핵심 포인트
- 에이전트 하네스 변경이 토큰 사용량에는 큰 영향을 주지만, 모델의 합격률 변화는 미미함.
- AI 에이전트 작업물 인계 시 비용 및 기록 관리 문제가 발생할 수 있음.
- 모델 성능 평가 시 어떤 하네스와 비용으로 실행되었는지 명확히 밝혀야 함.
연구자들은 동일한 두 개의 코딩 모델을 세 가지 오픈소스 에이전트 하네스(Goose, OpenCode 및 OpenHands-SDK)로 각각 50개의 Terminal-Bench Pro 과제에 돌렸습니다. 이 과정에서 하네스는 해결된 과제당 사용 토큰 수를 최대 40배까지 변화시켰지만, 합격률은 단지 0점에서 8점 사이의 변화만 보였습니다.
누군가 모델의 합격률을 인용할 때는 어떤 하네스에서 실행되었는지, 그리고 해결된 과제당 비용이 얼마였는지 물어보세요.
https://arxiv.org/abs/2607.22585
#AI
#AIAgents
코딩 에이전트는 일주일 분량의 작업을 오후에 끝낼 수 있게 해줍니다. 하지만 다음 사람이 이 작업을 이어받을 때 비용 문제가 발생하는데, 그 이유는 브랜치(branch)를 결정하는 과정이 세션 중간에 이루어졌고, 티켓(ticket) 작성 이후에 발생했기 때문에 다음 사람이 쉽게 찾아볼 수 있는 곳에 기록되어 있지 않기 때문입니다.
https://ericbrown.com/the-handoff-problem/
…
#AI
AI 자동 생성 콘텐츠
본 콘텐츠는 X Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기