도구 호출의 쓰라린 교훈 (The Bitter Lesson of Tool Calling)
요약
본 연구는 기존의 JSON 기반 도구 호출 대신 프로그래밍 방식 도구 호출(PTC)의 성능을 BFCL v4 벤치마크를 통해 검증합니다. 실험 결과, PTC는 대다수의 모델에서 JSON 방식보다 우수하거나 대등한 성능을 보였으며 특히 병렬 처리와 컨텍스트 로트 상황에서도 높은 안정성을 입증했습니다.
핵심 포인트
- 프로그래밍 방식 도구 호출(PTC)은 JSON 호출의 강력한 대안임
- 14개 모델 중 11개 모델에서 PTC가 JSON 방식보다 우수한 성능 기록
- GPT-4o 계열 모델에서 JSON 대비 성능 10.6% 향상 확인
- 병렬 팬아웃 및 컨텍스트 로트 조건에서도 높은 안정성 유지
Tool use는 LLM을 훈련 데이터 범위를 넘어 행동하는 에이전트로 변환시키며, 코드 기능을 갖춘 모델에게 있어 프로그래밍 방식 도구 호출(programmatic tool calling)은 경직된 JSON 호출을 자연스럽게 연결하고 병렬화하는 스크립트로 대체함으로써 이를 더욱 확장합니다. 하지만 현재 및 이전 세대의 모델들을 대상으로 실제 세계 과제 조건에서 확립된 벤치마크 위에서 코드로의 도구를 체계적으로 평가한 연구는 수행되지 않았습니다. 본 연구에서는 BFCL v4를 사용하여 14개의 언어 모델에 걸쳐 프로그래밍 방식 도구 호출(PTC)과 네이티브 JSON 도구 호출을 경험적으로 비교합니다. 프로그래밍 방식 도구 호출 패러다임에서는 도구가 타입 지정된 Python 스텁으로 노출되며, 모델은 이를 코드를 통해 호출하고 실행 및 결과는 단일 에이전트 턴에서 처리됩니다. 프로그램 방식 도구 호출은 BFCL v4의 14개 모델 중 11개에서 네이티브 JSON 도구 호출과 같거나 능가하는 성능을 보였으며, 특히 GPT-5.6 계열은 JSON 도구 호출 기준선 대비 10.6% 향상을 달성했습니다. 나아가, 병렬 팬아웃(parallel fan-out) 조건에서도 14개 모델 중 13개에서 같거나 우수한 성능을 보였고, 기준선이 평균 2.3% 저하되는 컨텍스트 로트(context rot) 조건에서도 안정성을 유지했습니다. 우리의 결과는 프로그래밍 방식 도구 호출이 JSON 도구 호출의 실행 가능하고 견고한 대안임을 입증하며, 성능이 출시 세대에 걸쳐 모델 역량에 따라 추적됨을 보여줍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기