에이전트 프롬프트의 토큰 압축 및 처리 방식에 대한 설명
요약
본 기사는 에이전트 프롬프트의 토큰을 효율적으로 압축하고 처리하는 기술적 방법을 설명합니다. 사용자의 로컬 환경에서 실행되어 데이터 외부 전송 없이 컨텍스트를 줄이며, 특히 중요한 정보를 손실 없이 유지하는 '헤드룸' 개념에 초점을 맞춥니다. JSON, 소스 코드, 일반 산문 등 콘텐츠 유형별로 최적화된 압축기를 사용하여 성능과 비용 효율성을 극대화합니다.
핵심 포인트
- 토큰을 로컬에서 압축하여 데이터 외부 전송 없이 컨텍스트를 줄입니다.
- 중요한 정보 손실 방지(헤드룸)에 중점을 둔 고도화된 압축 기술을 사용합니다.
- JSON, 소스 코드, 일반 산문 등 콘텐츠 유형별로 특화된 압축기가 적용됩니다.
- Opus급 모델의 높은 출력 비용 문제를 해결하여 컨텍스트 반복 설명을 줄입니다.
당신의 에이전트가 보낸 55,957 토큰 분량의 프롬프트가 모델에는 24,340 토큰으로 도달합니다. 항목 67에서 발생하는 치명적인(FATAL) 줄은 바이트 단위로 도착합니다.
이것이 바로 컨텍스트 압축의 어려운 부분입니다. 토큰을 잘라내는 것은 쉽습니다. 하지만 중요한 한 줄도 자르지 않는 것이 어렵습니다.
이를 헤드룸(Headroom)이라고 부릅니다. 압축은 사용자의 기기에서 실행되므로, 프롬프트나 파일이 외부로 나가서 압축될 필요가 없습니다.
→ 10,144 토큰 로그 덤프 → 1,260 토큰, 여전히 같은 FATAL 발견
→ SRE 디버깅 비용 57% 절감, 코드베이스 탐색 비용 42% 절감, 이슈 트리아지(issue triage) 비용 30% 절감
→ GSM8K에서 이전 점수 0.870, 이후 점수 0.870
→ 32% 압축률에서도 BFCL 도구 호출에서 97% 달성
→ 10K 토큰 페이로드에 대해 p50 기준 0.21 ms, 100K 토큰에 대해 1.4 ms
→ 가역적(reversible)입니다. 원본은 로컬에 캐시되며, 모델이 전체 텍스트가 필요할 때 headroom_retrieve를 호출합니다.
이는 콘텐츠 유형별로 라우팅됩니다. JSON은 SmartCrusher로, 소스 코드는 AST 압축기로, 일반 산문(prose)은 자체 모델로 처리됩니다.
그리고 청구서의 나머지 절반을 담당합니다. Opus급 모델에서 출력 비용이 입력 비용보다 5배 비싸기 때문에, 파일 읽기 후 재개되는 경우 사고 과정을 줄이고 컨텍스트를 반복해서 설명하는 것을 중단하도록 지시합니다. 또한, 모델이 작성했을 것이라고 가정하기보다는 추정치로 보고하며 ~31.7% (95% CI)의 수치를 보고합니다.
하나의 명령어만으로 Claude Code, Codex, Cursor, Aider, Copilot, Cline, Goose 및 10개 이상의 도구를 포괄합니다. 이 모든 것에 걸쳐 공유 메모리를 사용합니다.
호스팅되는 압축 API와 제공업체 네이티브 압축 기능을 대체합니다.
100% 오픈 소스입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @nainsidwiv50980 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기