토큰 절약 플러그인: 압축된 출력이 아닌 완료된 작업당 비용을 측정하라
요약
토큰 절약 도구의 효용성을 평가할 때 단순 출력 압축률이 아닌, 성공적으로 완료된 작업당 비용을 측정해야 함을 강조합니다. 실험 결과, 출력 압축은 전체 비용 구성 요소 중 극히 일부에 불과하여 실질적인 비용 절감 효과가 낮음을 보여줍니다.
핵심 포인트
- 단순 출력 압축보다 '성공한 작업당 비용' 지표가 더 중요함
- 전체 토큰의 대부분은 출력보다 캐시된 입력에서 발생함
- 출력 압축률이 높아도 전체 비용 절감 효과는 미미할 수 있음
- 비용 측정 시 재시도, 라운드 수, 소요 시간 등을 종합적으로 고려해야 함
저는 Tura를 유지 관리하고 있으며, 많은 토큰 절약 도구들이 전체 코딩 작업을 측정하지 않은 채 큰 압축률만을 광고하는 것을 보고 이 분석을 작성했습니다.
핵심 문제는 분모입니다. 플러그인이 한 번의 명령 출력을 줄일 수는 있지만, 에이전트는 여전히 캐시된 컨텍스트 (cached context), 캐시되지 않은 입력 (uncached input), 추론 (reasoning), 재시도 (retries), 추가 라운드 (extra rounds), 그리고 실패한 실행 (failed runs)에 대한 비용을 지불합니다. 따라서 유용한 지표는 반복된 실행을 통해 측정된 **성공적으로 완료된 작업당 비용 (cost per successful completed task)**입니다.
테스트 내용
저는 저장소 재작성 (repository-rewrite) 작업을 사용했습니다: Rust CLI인 eza를 동작 호환성이 있는 Python으로 번역하는 작업이며, 52개의 하네스 어설션 (harness assertions)으로 평가되었습니다. 실행에는 Codex CLI 0.144.1을 통해 GPT-5.6-sol High를 사용했습니다.
세 가지 실험군이 있었으며, 각 실험군당 두 번씩 실행했습니다:
| 설정 (Configuration) | 통과율 (Pass rate) | 평균 관찰된 토큰 (Mean observed tokens) | 평균 모델링된 비용 (Mean modeled cost) | 평균 라운드 (Mean rounds) | 평균 소요 시간 (Mean duration) |
|---|---|---|---|---|---|
| 플러그인 없음 (No plugin) | 78.85% | 6.660M | $5.282 | 62.5 | 895s |
| ... |
Ponytail은 관찰된 토큰을 7.56% 줄이고 모델링된 비용을 8.87% 줄였지만, 소요 시간은 13.51% 증가시켰습니다. RTK는 토큰을 13.20%, 비용을 7.18%, 라운드를 44%, 소요 시간을 40.69% 증가시켰습니다.
이것은 소표본 결과이며 신뢰 구간 (confidence intervals)이 아닙니다. 실험군당 단 두 번의 실행만 수행되었으므로 인과 관계를 확립하지는 못합니다. 실제로 실험군 내 비용 변동 (within-arm cost variation)은 컸습니다: 베이스라인은 43.25%, Ponytail은 51.69%, RTK는 30.78%였습니다.
헤드라인 퍼센티지가 오해를 불러일으킬 수 있는 이유
별도의 140회 실행 Codex 데이터셋을 통해 확인한 결과, 관찰된 토큰의 96.46%가 캐시된 입력 (cached input)이었으며, 출력 (output)은 0.38%에 불과했습니다. 따라서 좁은 출력 스트림을 완벽하게 압축하더라도 지배적인 비용 구성 요소를 제거할 수는 없습니다.
예를 들어:
- Ponytail의 주입된 규칙 (injected rules)은 약 569 토큰이었습니다. 매 라운드마다 불가능한 수준인 90%의 감소를 달성하더라도, 모델링된 총 비용의 약 0.44%만을 절감할 수 있습니다.
- 최종 생성된 코드 (Final production code)는 전체 토큰의 0.0568%를 차지했습니다. 여기서 이상적인 80%의 감소를 적용하더라도 총 비용 절감액은 약 1.81% 수준에 그칩니다.
- RTK 대상 셸 출력 (RTK-eligible shell output)은 토큰의 0.1618%를 차지했습니다. 완벽한 90% 압축을 수행하더라도 직접적으로 귀속되는 절감액은 약 0.96%에 불과합니다.
실질적인 교훈은 압축이 무용하다는 것이 아닙니다. 주장이 측정된 경계(measured boundary)와 일치해야 한다는 것입니다. 성공률 (success rate), 총 토큰 (total tokens), 총 비용 (total cost), 경과 시간 (elapsed time), 재시도 (retries), 그리고 라운드 (rounds)를 함께 보고하고, 분산 (variance)을 드러낼 수 있을 만큼 동일한 작업을 충분히 반복하십시오.
전체 방법론, 원시 계산 (raw calculations), 그리고 주의 사항 (caveats)은 해당 기사에 있습니다. 재현 가능한 구현체와 벤치마크 자료는 Tura의 저장소 (repository)에서 확인할 수 있습니다.
공개 사항: 저는 Tura를 운영하며 링크된 분석글을 작성했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기