Agent in a Bottle: LLM 에이전트가 자신의 역량을 저렴하고 확장 가능한 아티팩트로 전환할 수 있을까?
요약
LLM 에이전트가 복잡한 워크로드를 저렴하고 확장 가능한 아티팩트로 자율적으로 변환하는 능력을 '병입(bottling)'이라 정의했습니다. BOTTLED 벤치마크를 통해, 강력한 제로샷 성능만으로는 충분하지 않으며, 실제 병입 능력이야말로 비용 효율적인 솔루션 구축에 핵심임을 입증했습니다.
핵심 포인트
- LLM 에이전트의 '병입'은 일반 역량을 저렴한 작업별 솔루션으로 전환하는 능력입니다.
- BOTTLED 벤치마크는 제한된 자원 내에서 워크로드를 해결하는 에이전트 능력을 평가합니다.
- 제로샷 성능과 병입 능력 사이에는 큰 괴리가 존재하며, 실제 비용 절감 효과가 입증되었습니다.
대규모 언어 모델(LLMs)은 많은 좁은 작업들을 해결할 수 있지만, 관련 인스턴십 백만 개에 대해 각각 질의하는 것은 엄청나게 비쌀 수 있습니다. LLM 에이전트가 이러한 워크로드에 대해 더 저렴한 솔루션을 자율적으로 생성할 수 있을까요? 우리는 이 능력을 '병입(bottling)'이라고 부릅니다: 일반적인 역량을 답변 품질과 상각 비용의 균형을 맞추는 작업별 솔루션으로 전환하는 능력입니다. 우리는 BOTTLED라는 벤치마크를 소개합니다. 이 벤치마크에서 에이전트는 전체 레이블 없는 워크로드를 받고, 고정된 시간, 컴퓨팅 및 LLM API 예산 내에서 이를 완료해야 합니다. 에이전트는 작은 모델을 훈련시키거나 재사용 가능한 프로그램을 작성하는 등 자신만의 접근 방식을 선택합니다. 열 개의 모델과 세 가지 작업을 거쳐, 우리는 강력한 제로샷(zero-shot) 작업 성능이 반드시 강력한 병입 능력으로 이어지지 않는다는 것을 발견했습니다. 유사한 제로샷 점수를 가진 모델이라도 병입 후에는 크게 달라질 수 있으며, 60번의 병입 실행 중 48번은 해당 모델의 제로샷 성능 95% 신뢰 구간 하한선보다 낮은 점수를 기록했습니다. 더욱이, 60번의 실행 중 31번은 동일한 토큰 예산으로 구축된 두 가지 소형 모델 증류(small-model distillation) 기준선 중 더 강력한 것보다 낮은 성능을 보였습니다. 그럼에도 불구하고, 병입은 상당한 절감 효과를 가져올 수 있습니다: 질의-제품 관련성 분류 작업에서 Opus 5는 약 82%의 제로샷 매크로-F1 점수를 유지하면서도 보고된 비용이 약 657배 낮습니다. 또한, 병입은 저렴하고 반복적인 추론을 위해 특별히 구축된 '시스템 원(system one)' 모델인 Jev와도 경쟁력이 있습니다: Opus 5는 동일한 작업에서 Jev의 매크로-F1 점수의 약 94%를 회복하면서도 Jev가 예상하는 전체 워크로드 비용의 4분의 1에 불과한 비용을 사용합니다. BOTTLED는 대규모의 반복적인 워크로드에 대해 제한된 자원을 재사용 가능한 솔루션에 투자하는 에이전트의 능력을 평가하고 개선하기 위한 기반을 제공합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기