토큰 데이터를 활용하여 AI 에이전트 경험 개선하기
요약
토큰 사용량 지표를 분석하면 AI 에이전트의 작업 수행 과정을 깊이 이해할 수 있습니다. 단순히 성공 여부를 넘어, 검색이나 재시도 과정에서 발생하는 추가적인 작업량을 파악하여 효율적인 워크플로우를 설계하는 데 도움을 줍니다. 입력/출력 토큰 외에 추론 토큰까지 고려해야 하며, 이는 에이전트의 행동 경로와 복잡성을 측정하는 중요한 지표가 됩니다.
핵심 포인트
- 토큰 사용량은 에이전트의 작업 과정(검색, 재시도 등)을 반영합니다.
- 입력/출력 외 추론 토큰까지 고려하여 모델의 사고 과정을 분석해야 합니다.
- 토큰 분석을 통해 비효율적인 워크플로우와 효율적인 경로를 구분할 수 있습니다.
토큰 사용량은 특정 작업의 시작부터 최종 답변까지 어떤 일이 있었는지 많은 것을 알려줍니다. 에이전트가 작업을 성공적으로 완료하더라도, 여러 번 문서를 검색하거나, 실패한 단계를 재시도하거나, 관련 없는 도구 출력을 대량으로 컨텍스트에 끌어들인 후에만 그럴 수 있습니다. 반복된 시도 전반의 토큰 사용량 지표를 살펴보면 이러한 추가적인 작업량을 파악하고, 직접적이고 효율적인 워크플로우와 추가적인 컨텍스트, 재시도 등에 의존하는 워크플로우를 구분할 수 있습니다.
토큰은 누적됩니다
토큰은 모델이 콘텐츠를 처리하는 데 사용하는 단위입니다. 텍스트에서 토큰은 대략 단어의 3/4 정도이지만, 다양한 모델들이 다른 토크나이저(tokenizer)를 사용하기 때문에 같은 텍스트라도 시스템에 따라 다른 토큰 수를 생성할 수 있습니다. 이러한 차이는 또한 동일한 토큰 총합이 모든 모델에서 반드시 동일한 양의 콘텐츠나 계산량을 나타내지는 않는다는 것을 의미합니다.
토큰 사용량은 보통 입력(input) 토큰과 출력(output) 토큰의 숫자로 측정되며, 일부 모델은 추론 토큰(reasoning tokens)도 보고할 수 있는데, 이는 추론 모델의 사고 과정(chain of thought)에서 사용됩니다. 입력 토큰은 프롬프트(prompt), 대화 기록(conversation history), 문서, 코드 및 도구 결과를 포함하여 모델에 전송되는 모든 것을 의미합니다. 출력 토큰은 모델이 응답으로 생성하는 것입니다. 에이전트 워크플로우에서는 더 많은 컨텍스트가 여러 모델 호출을 거치면서 입력 토큰이 빠르게 증가할 수 있습니다.
다양한 호스팅 모델 제공업체들이 토큰을 가격 책정하는 방식도 제공업체마다 다르지만, 일반적으로는 입력 토큰보다 출력 토큰이 토큰당 더 비싼 경우가 많으며, 심지어 입력 토큰이 전체 사용량의 대부분을 차지할 때에도 마찬가지입니다.
아래 예시는 Quantiles를 통해 단일 에이전트 평가(agent evaluation) 작업을 추적하며, 워크플로우의 각 단계에서 사용된 입력 및 출력 토큰을 분석합니다.
Quantiles 평가 작업 전반의 토큰 사용량 추적

토큰을 활용하여 에이전트 행동 이해하기
에이전트 워크플로우에서 토큰 사용량은 에이전트가 작업을 수행하는 과정(context를 읽는 것, 호출하는 도구, 시도하는 재시도 횟수, 전달하는 정보 등)의 경로를 반영하는 데 도움이 될 수 있습니다. 이는 단순히 작업 완료 여부를 넘어선 행동에 대한 유용한 신호입니다. 예를 들어, 두 번의 시도가 모두 성공할지라도, 한 시도는 더 많은 컨텍스트와 추가적인 탐색(exploration), 더 많은 복구 단계(recovery steps)가 필요하고 더 긴 실행 시간이 걸릴 수 있습니다.
최근 연구는 이러한 경로가 얼마나 다양할 수 있는지 보여줍니다. SWE-bench Verified에 대한 8개 최첨단 모델(frontier models)의 2026년 연구에 따르면, 동일한 작업을 반복 실행했을 때 총 토큰 사용량은 최대 30배까지 차이가 날 수 있었습니다. 또한, 더 많은 토큰이 반드시 더 나은 결과를 가져오지는 않았습니다. 정확도는 종종 중간 수준의 토큰 사용량에서 정점을 찍고, 소비가 계속 증가함에 따라 평탄화되는 경향을 보였습니다.
평가 과정에서 주목할 만한 몇 가지 패턴은 다음과 같습니다:
- 반복적인 문서 읽기. 에이전트가 필요한 지침을 찾거나, 읽거나, 해석하는 데 어려움을 겪을 수 있습니다.
- 대용량 도구 응답. 도구가 작업에 필요한 것보다 훨씬 많은 컨텍스트를 반환할 수 있습니다.
- 재시도 및 복구. 에이전트가 오류를 만나거나, 이전 단계를 재방문하거나, 여러 접근 방식을 시도할 때 토큰 사용량이 빠르게 증가할 수 있습니다.
- 증가하는 컨텍스트. 긴 대화, 도구 출력, 중간 결과 등이 모델 호출을 거치며 축적되어 입력 토큰 사용량을 늘릴 수 있습니다.
- 불필요한 탐색. 에이전트가 작업과 관련 없는 파일, API 또는 문서를 검사할 수 있습니다. 경우에 따라서는 필요한 데이터를 가져오기 위해 관련 없는 대량의 데이터까지 컨텍스트로 불러와야 할 수도 있습니다.
- 추가적인 검증. 높은 사용량이 항상 낭비는 아닙니다. 때로는 추가 토큰이 작업 확인, 구현 테스트 또는 최종 결과 유효성 검사에서 발생할 수 있습니다.
가장 중요한 것은 단순히 토큰 수가 높거나 낮은지 여부가 아니라 패턴입니다. 동일한 작업을 여러 번 실행하면 시도 간의 사용량을 비교하고 의미 있는 차이를 발견할 수 있습니다. 만약 한 시도가 다른 시도보다 상당히 많은 토큰을 사용한다면, 트레이스(trace)는 에이전트가 같은 결과에 도달하기 위해 더 많은 컨텍스트, 재시도 또는 복구 노력이 필요했는지 보여주는 데 도움이 될 수 있습니다.
에이전트 경험 개선을 위한 토큰 데이터 활용
개발자 도구의 경우, 토큰 사용량은 단순히 모델 비용 그 이상입니다. 이는 에이전트가 귀하의 제품을 성공적으로 사용하는 데 얼마나 많은 작업을 해야 하는지 알려줄 수 있습니다.
만약 에이전트가 지속적으로 많은 양의 컨텍스트를 필요로 하거나, 반복적인 도구 호출을 하거나, 일반적인 워크플로우를 완료하기 위해 여러 번 시도해야 한다면, 이는 제품 자체에 마찰(friction)이나 진입 장벽이 있다는 신호일 수 있습니다. 에이전트가 추가 토큰을 소모하는 이유는 문서 탐색이 어렵거나, 도구 응답에 필요한 것보다 더 많은 정보가 포함되어 있거나, API가 너무 많은 단계를 요구하거나, 오류 메시지가 깔끔하게 복구할 만큼 충분한 안내를 제공하지 못하기 때문일 수 있습니다. 이러한 관점에서 볼 때, 과도한 토큰 사용은 제품이 에이전트에게 불필요하게 더 많은 노력을 기울이게 만드는 지점을 가리킬 수 있습니다.
아래 표는 토큰 사용 데이터가 에이전트 경험 개선을 위한 기회를 어떻게 제시할 수 있는지 보여줍니다.
에이전트 경험 개선 기회
| 기회 | 도움이 되는 방식 |
|---|---|
| 불필요한 컨텍스트 감소 | 더 작고 집중된 도구 응답과 명확한 문서화는 관련 없는 정보를 모델 컨텍스트에서 제외하는 데 도움을 줄 수 있습니다. |
| ... | |
| 토큰 사용량이 적은 것이 그 자체로 목표는 아닙니다. 에이전트가 이해하고, 탐색하며, 효율적으로 사용할 수 있는 제품을 만드는 것이 더 중요합니다. 토큰 사용 추이를 작업 성공률 및 실행 트레이스와 함께 추적함으로써, 어떤 경험이 이미 잘 작동하고 있는지, 그리고 개선을 통해 에이전트 워크플로우를 더욱 빠르고, 신뢰할 수 있으며, 성공적으로 만들 수 있는 곳은 어디인지 파악할 수 있습니다. |
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기