Microsoft가 발표한 데이터: 에이전트 도구 인터페이스에 대한 관점을 바꾼다
요약
Microsoft가 발표한 연구에 따르면, 에이전트 도구 인터페이스에서 Bash 사용만으로도 타이핑된(typed) 도구를 사용하는 것보다 높은 성능을 보였으며 토큰 사용량은 적었습니다. 이는 복잡한 다중 에이전트 시스템 구축 시 기존의 정교한 도구 카탈로그 방식에 대한 근본적인 의문을 제기합니다.
핵심 포인트
- Bash만으로도 충분히 구조화되어 있어, 고정된 도구 카탈로그가 필수적이지 않다.
- 샌드박싱 환경이 가능하다면, 에이전트에게 셸 접근을 허용하는 것이 성능에 유리할 수 있다.
- 어떤 인터페이스가 객관적으로 우월한지보다, 어떤 에이전트가 특정 인터페이스에서 더 잘 작동하는지 경험적 측정이 중요하다.
- Microsoft의 데이터는 다중 에이전트 오케스트레이션 플랫폼 구축 시 중요한 참고 자료이다.
Microsoft는 제가 에이전트 도구 인터페이스에 대해 생각하는 방식을 변화시키는 데이터를 발표했습니다. TheAgentCompany 벤치마크에서 Bash만 사용해도 타이핑된(typed) 도구보다 21점에서 24점 더 높은 성능을 보였으며, 토큰은 19%에서 72% 적게 사용했습니다. 여기에 타이핑된 도구를 추가하는 것은 측정 가능한 이득이 없었습니다.
이는 다중 에이전트 시스템을 구축하는 모든 사람에게 매우 중요한 문제입니다.
현재 일반적인 패턴은 정교한 도구 카탈로그를 구축하는 것입니다: 각 API에 대한 함수, 타이핑된 스키마, 엄격한 매개변수 유효성 검사 등이 그것입니다. 가정은 구조가 에이전트가 더 나은 결정을 내리도록 돕는다는 것입니다. 하지만 Microsoft의 논문은 이를 정면으로 반박합니다. Bash는 이미 충분히 구조화되어 있습니다. 그리고 고정된 도구 카탈로그로는 절대 할 수 없는 방식으로 작업 전반에 걸쳐 일반화됩니다.
여기에는 실제적인 상충 관계(tradeoff)가 존재합니다: bash는 샌드박스 실행 환경을 필요로 합니다. 만약 샌드박싱할 수 없다면, 정의된 권한이 있는 타이핑된 카탈로그가 필요합니다. 하지만 샌드박싱할 수 있다면, 에이전트가 셸 접근(shell access)을 사용하도록 허용하지 않음으로써 상당한 성능 손실을 보고 있는 것입니다.
이는 제가 오픈 소스 다중 에이전트 오케스트레이션 플랫폼인 Campfire와 함께 고민해 온 것과 연결됩니다. 같은 문제에 대해 Claude Code, Codex, Goose, Aider를 나란히 실행할 때, 이들 각 에이전트는 이미 자체 도구 인터페이스 모델을 가지고 있습니다. Claude Code는 bash를 선호합니다. Codex는 함수 호출(function calling)을 선호합니다. Aider는 diffs 위에서 작동합니다.
질문은 어떤 도구 인터페이스가 객관적으로 더 좋은지가 아닙니다. 어떤 에이전트가 어떤 인터페이스로 더 나은 결정을 내리는지입니다. Microsoft의 데이터는 타이핑된 도구가 더 안전하거나 더 신뢰할 것이라고 가정하는 대신, 자체 환경에서 이를 경험적으로 측정해야 함을 시사합니다.
Campfire를 사용하면 이러한 비교를 쉽게 실행할 수 있습니다. 에이전트 인프라를 구축하고 있다면, 이 논문은 필독서입니다. 데이터는 명확하며 벤치마크 커버리지는 광범위합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기