에이전트/도구 사용을 위해 로컬에서 테스트한 15개 모델 (Bonsai 27B가 마지막)
요약
본 기사는 15개의 로컬 LLM을 대상으로 Toolery라는 벤치마크를 사용하여 에이전트 및 도구 사용 능력을 비교 분석한 결과를 담고 있습니다. 이 테스트는 다양한 난이도의 시나리오에서 모델들이 실제로 작업을 완료하는 능력을 측정했습니다. 분석 결과, 각 모델의 성능 지표와 실패 원인을 상세히 제시하며, 특히 Bonsai 모델은 예산 초과(budget_violated)로 인해 어려움을 겪었음을 밝히고 있습니다.
핵심 포인트
- Toolery 벤치마크를 통해 로컬 LLM의 에이전트/도구 사용 능력을 검증함.
- 모델 실패 원인이 도구 선택 오류가 아닌, 과도한 도구 호출(예산 초과)에 있음을 발견함.
- Qwen3.8-27b와 Gemma-4 계열 모델들이 전반적으로 높은 성능을 보임.
- Bonsai는 예산 초과 문제로 인해 Very Hard 시나리오에서 낮은 점수를 기록했음.
저는 어떤 로컬 모델들이 실제로 에이전트(agent)/도구 사용(tool-use) 작업에 활용 가능한지 확인하고 싶어서, 모델의 과장된 홍보만 믿기보다는 15개의 모델을 동일한 벤치마크로 돌려봤습니다.
이 벤치마크는 Toolery입니다. 단순히 모델이 도구를 호출할 수 있는지 여부만을 검사하는 것이 아니라, 다양한 제약 조건 하에서 실제로 작업을 완료하도록 요구하는 시나리오들로 구성되어 있습니다.
- 143개의 시나리오
- 시나리오당 3회 트라이얼
- 모델당 총 429회의 트라이얼
- Easy, Medium, Hard, Very Hard 등급으로 구분된 난이도
- 모든 과정은 LM Studio를 통해 로컬에서 처리
- API 비용 없음
- 모든 모델에 대해 30k 토큰 컨텍스트 창 제공
- 모든 모델에 대해 Temperature 0.8 설정
- 그 외의 설정들은 각 모델이 LM Studio에서 기본으로 제공하는 설정을 유지했습니다.
- 예외는 qwen3.8-flash-next였는데, 여기서는 Strata를 사용했지만 온도(temperature)는 0.8로 설정했습니다.
- Concurrency: 4
- Timeout scale: 4.0
결과:
모델 이름 | Easy | Medium | Hard | Very Hard |
| :--- | :---: | :---: | :---: | :---: |
| 1 qwen/qwen3.8-27b | 71.8% | 96.7 | 93.3 | 71.6 | 41.7 |
| 2 mellum2-12b-a2.5b-thinking | 71.4% | 88.3 | 91.1 | 71.6 | 45.8 |
| 3 google/gemma-4-26b-a4b | 70.4% | 92.5 | 93.3 | 60.8 | 50.0 |
| 4 granite-4.2-8b | 67.8% | 85.8 | 88.9 | 62.7 | 45.8 |
| 5 qwen3.8-flash-next-iq2_xs | 64.5% | 89.2 | 91.9 | 62.7 | 30.6 |
| 6 mistralai/devstral-small-2-2512 | 63.9% | 75.8 | 83.7 | 58.8 | 45.8 |
| 7 ornith-1.5-9b | 62.3% | 84.2 | 83.7 | 60.8 | 34.7 |
| 8 lfm2.5-8b-a1b | 61.6% | 72.5 | 74.1 | 55.9 | 51.4 |
| 9 ornith-1.5-35b-a3b | 61.0% | 85.8 | 84.4 | 57.8 | 31.9 |
| 10 meta/muse-glimmer | 60.0% | 87.5 | 92.6 | 52.0 | 26.4 |
| 11 qwen3.8-27b-gsq-rco | 59.0% | 84.2 | 85.9 | 51.0 | 31.9 |
| 12 gpt-oss-20b | 58.6% | 81.7 | 86.7 | 53.9 | 27.8 |
| 13 google/gemma-4-12b-qat | 56.7% | 84.2 | 83.0 | 46.1 | 31.9 |
| 14 qwen3-coder-30b-a3b-instruct | 54.3% | 60.0 | 73.3 | 51.0 | 37.5 |
| 15 prism-ml/bonsai-27b | 50.5% | 65.8 | 64.4 | 58.8 | 22.2 |
[IMG:N]
결론적으로, Bonsai가 전체적으로 가장 마지막이었습니다.
특히 Very Hard 시나리오에서는 단지 22.2%에 그쳤습니다.
하지만 더 흥미로운 부분은 왜 실패했는지입니다.
실패 모드
Bonsai는 총 148회의 실패한 시도가 있었습니다.
그중 103건은 budget_violated(예산 초과)로 분류되었습니다.
이는 모델이 종종 올바른 도구를 선택하고 정확한 결과를 얻었지만, 그 후 시나리오가 허용한 것보다 한 번 더 도구 호출을 했다는 것을 의미합니다.
따라서 문제는 항상 '어떤 도구를 사용해야 할지 모르겠다'는 것이 아니었습니다.
오히려 다음과 같은 경우였습니다:
'내가 뭘 하는지는 아는데, 이걸 한 번만 더 호출하게 해줘.'
그리고 그 결과 도구 예산이 초과된 것입니다. 실제로 제가 가장 흥미롭다고 느낀 부분이 바로 이 점입니다. 모델은 때때로 작업을 올바르게 수행할 수 있지만, 언제 멈춰야 하는지 알지 못합니다.
비교하자면:
qwen3.8-27b가 71.8%로 1위를 차지했습니다.
qwen3.8-27b는 총 84회의 실패한 시도를 기록했습니다.
granite-4.2-8b는 전반적으로 가장 적은 실패를 보였으며, 69건이었습니다.
속도 또한 좋지 않았습니다.
Bonsai가 이번 테스트에서 가장 느린 모델이었습니다.
총 벽시계 시간(wall-clock time)은 6,208초였습니다.
다음으로 느린 모델은 약 5,750초가 걸렸지만, 점수는 약 17점 더 높았습니다.
qwen flash 모델은 시나리오당 약 9초가 소요되었습니다.
중요한 주의사항
이것은 최신 Bonsai 2 27B가 아니라 원래의 Bonsai 27B입니다.
압축 자체는 여전히 흥미롭습니다. 27B급 모델을 1-bit 버전으로 약 4GB에 담았다는 것은 매우 인상적이며, 모델이 원래의 많은 능력을 유지하고 있음을 보여줍니다.
하지만 이 벤치마크는 오직 한 가지 특정 측면만을 테스트합니다:
'제약 조건 하에서 도구 사용/에이전트 작업을 완료해야 할 때 이 특정 모델이 어떻게 행동하는가?'
이는 일반적인 지능 벤치마크가 아니며, Bonsai가 나쁜 모델임을 증명하지는 않습니다.
결과는 더 구체적입니다:
압축은 인상적이지만, 원래의 1-bit Bonsai 27B는 이 테스트에서 놀라울 정도로 약한 에이전트/도구 사용 행동을 보였습니다. 특히 언제 멈춰야 하는지 아는 부분에서 그러했습니다.
저는 또한 Bonsai 2를 정확히 동일한 벤치마크로 실행해 보고 싶습니다.
이것은 더 최신 Qwen3.8 27B 계열을 기반으로 하므로, 원래의 Bonsai를 모든 것과 비교하는 것보다 버전들을 분리하여 비교하는 것이 훨씬 더 흥미로울 것입니다.
한계점(Limitations)
이번 테스트는 다음 요소들로 구성되었습니다:
- 하나의 벤치마크
- 하나의 하네스(harness)
- 모델당 한 번의 실행(run)
- 30k 컨텍스트 창(context window)
- 온도(temperature) 0.8
- 대부분 각 모델에 대한 기본 LM Studio 설정
- 하나의 어댑터 구성(adapter configuration)
- 양자화 및 컨텍스트 설정을 사용한 로컬 서빙(local serving)으로, 완벽하게 정규화되지 않았습니다.
따라서 이것을 스냅샷(snapshot)으로 간주해 주십시오.
제출자: /u/Reno0vacio
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기