
Sir Shortoken: 모든 LLM을 위한 절제된 AI 출력 방식
요약
Sir Shortoken은 LLM의 불필요한 답변을 줄이기 위해 정보 예산(Quick/Balanced/Deep) 개념을 도입한 시스템 프롬프트입니다. 기술적 정확도를 유지하면서도 토큰 사용량을 40-60% 절감하여 효율적인 정보 전달을 가능하게 합니다.
핵심 포인트
- 정보 예산 설정을 통해 모델의 출력 길이를 제어
- 기술적 질의에서 정보 손실 없이 토큰 사용량 40-60% 감소
- 의미론적 압축을 활용하여 핵심 구조 중심의 답변 제공
- Claude, GPT, Gemini 등 주요 프론티어 모델에서 작동 가능
요약 (TL;DR): Sir Shortoken은 프론티어 모델(frontier models)이 정보 예산(Information Budgets: Quick/Balanced/Deep) 내에서 작동하도록 제한하고, 능력을 조용히 확대하지 않으며, 실행을 증명하도록 강제하는 시스템 프롬프트(system prompt)입니다. Claude, GPT, Gemini를 통해 테스트되었습니다. 정보 손실 없이 기술적 질의에서 40-60%의 토큰(token) 감소를 달성했습니다.
GitHub: https://github.com/shouvik12/sir-shortoken
문제점 (The Problem)
Claude에게 OAuth 2.0에 대해 설명해달라고 요청하면, 요청하지도 않은 역사적 배경, 보안 예외 사례, 구현 세부 사항이 포함된 2,000단어 분량의 답변을 받게 됩니다.
결국 당신은 스크롤만 내리게 됩니다.
이것은 모델의 잘못이 아닙니다. 모델은 완전성(completeness)을 최적화하도록 설계되었기 때문입니다. 하지만 코드 리뷰, API 문서화, 기술 교육 등 대규모로 이를 실행할 때는 이러한 낭비되는 토큰들이 쌓이게 됩니다.
더 중요한 것은: 당신이 노이즈(noise) 사이에서 신호(signal)를 걸러내는 데 시간을 낭비한다는 점입니다.
접근 방식: 정보 예산 (Information Budgets)
모델에게 "핵심 개념만 말해줘, 다른 건 필요 없어"라고 말할 수 있다면 어떨까요?
그리고 모델이 그 명령을 준수한다면요?
저는 프론티어 모델이 기술적 정확성을 잃지 않으면서 엄격한 정보 제약 조건 하에서 작동할 수 있는지 테스트하기 위해 Sir Shortoken을 구축했습니다.
가설: 의미론적 압축 (Semantic compression)은 존재한다. 모델은 아이디어의 핵심 구조를 추출하여 설명할 수 있으며, 상세한 설명을 줄이면서도 이해도를 유지할 수 있습니다.
작동 원리
세 가지 규칙:
- 내부 지식으로만 답변할 것 — 웹 검색이나 도구(tools)를 조용히 사용하지 말 것
- 정보 예산을 준수할 것 — Quick/Balanced/Deep/Unlimited 범위 내에 머무를 것
- 실행 증명을 보여줄 것 — 사용된 내용을 표시할 것 (Ledger)
호출 방식:
Sir Shortoken [budget]: [query]
예시:
Sir Shortoken balanced: Explain OAuth 2.0
출력:
OAuth 2.0는 권한 부여 프레임워크 (authorization framework)입니다. 제3자 앱이 사용자의 리소스에 접근할 수 있는 권한을 요청합니다. 사용자가 권한을 부여하면, 앱은 토큰 (token)을 받게 되며, 사용자의 비밀번호 대신 해당 토큰을 사용합니다.
...
간결함. 구조적임. 증명 가능함.
예산 (The Budgets)
| 모드 (Mode) | 토큰 (Tokens) | 범위 (Scope) | 사용 사례 (Use Case) |
|---|---|---|---|
| Quick | 200-400 | 핵심 개념만 포함 | 빠른 학습, 빠른 참조 |
| ... |
테스트 결과
6개의 스위트 (suites)에 걸쳐 23개의 테스트 케이스를 실행했습니다. 통과한 결과는 다음과 같습니다:
스위트 1: 예산 진행 (동일 쿼리, 다른 예산)
쿼리 (Query): "TCP/IP가 어떻게 작동하는지 설명해줘"
| 모드 (Mode) | 출력 토큰 (Output Tokens) | 커버리지 (Coverage) |
|---|---|---|
| Quick | 194 | 전체의 ~35% |
| ... |
확장 비율: 레벨당 2.3x → 2.7x → 5.5x.
주요 발견 사항: 예산 규율은 실재하며 비례적입니다. Quick 모드는 단순히 잘라내는 것이 아니라 구조를 재편성하는 것입니다. 모델은 의미론적 골격 (semantic skeleton)을 추출합니다.
스위트 2: 경계 준수 (지식 컷오프 강제)
테스트: 허가 없이 최신 정보를 요구하는 쿼리
Sir Shortoken balanced: 이번 주 AI 규제에 어떤 일이 있었나요?
결과:
제 내부 지식만으로는 이 질문에 신뢰할 수 있는 답변을 드릴 수 없습니다.
제 학습 데이터는 2025년 1월에 종료되었습니다. 이 질문은 ...
주요 발견 사항: 조용한 에스컬레이션 (silent escalation)이 없습니다. 모델이 먼저 질문합니다. 이것이 핵심적인 강제 규칙입니다.
권한이 부여된 테스트:
Sir Shortoken balanced: 최신 AI 규제 변경 사항을 웹에서 검색해줘
결과: 사용자가 명시적으로 요청했기 때문에 모델이 검색을 수행합니다. 원장 (Ledger)에는 Web = Approved & Used라고 표시됩니다.
스위트 3: 지식 도메인 정확도
안정적인 지식 (수학, 컴퓨터 과학 (CS), 역사, 철학)을 대상으로 테스트했습니다. 모두 정확했습니다. 모두 예산 범위 내에 있었습니다. 웹 검색은 적절하게 거부되었습니다.
스위트 4: 일관성
동일한 쿼리로 동일한 세션에서 세 번 호출했습니다. 토큰 수(token count)가 일관되었습니다 (±10%). 세 번 모두 멘탈 모델 (mental model)이 유지되었습니다.
강제 메커니즘 (The Enforcement Mechanism)
skill.md에는 명시적인 강제 규칙이 포함되어 있습니다:
## 강제 규칙 (Enforcement Rules)
"Sir Shortoken [budget]:"을 보면 다음 규칙을 정확히 따르십시오:
...
이것은 매우 중요합니다. 명시적인 강제 규칙 (Enforcement rules)이 없다면, Claude는 문맥으로부터 추론하며, 이는 경계 사례 (boundary cases)에서 조용한 에스컬레이션 (silent escalation)으로 이어집니다.
강제 규칙이 있을 때: 조용한 에스컬레이션 없음. 모델은 먼저 질문합니다. 항상 말이죠.
실전 사례: 대규모 코드 리뷰 (Code Review at Scale)
사용 사례: 보안 문제를 확인하기 위해 100개의 API 변경 사항을 검토함.
Sir Shortoken 미사용 시:
- 리뷰당 800 토큰 (설명, 문맥, 주의 사항 포함)
- 100개 리뷰 = 80,000 토큰
- 읽는 데 걸리는 시간: 약 2시간
- 비용: 약 $0.40
Sir Shortoken 사용 시 (Balanced 모드):
- 리뷰당 300 토큰 (핵심 문제만 포함)
- 100개 리뷰 = 30,000 토큰
- 읽는 데 걸리는 시간: 약 45분
- 비용: 약 $0.15
결과: 토큰 62% 감소. 시간 67% 감소. 보안 수준은 동일함.
손실 없는 압축 (Compression Without Loss)
여기 핵심적인 발견이 있습니다: 정보 밀도 (Information density)는 실재합니다.
TCP/IP 설명에 대한 Quick 모드 적용 시:
- 194 토큰
- 포함 내용: 2계층 모델 (two-layer model), 라우팅 (routing), 신뢰성 (reliability), 흐름 제어 (flow)
- 생략 내용: 패킷 구조 (packet structures), 알고리즘 (algorithms), 예외 사례 (edge cases)
Quick 모드를 읽은 사람은 Balanced 모드의 80%를 재구성할 수 있습니다. 핵심 구조가 그 안에 있기 때문입니다.
이것은 손실 압축 (lossy)이 아닙니다. 우선순위 지정 (prioritized)입니다.
한계점 (Limitations)
Sir Shortoken이 할 수 없는 것:
- 최신 정보가 필요한 질문에 답변 (검색 권한이 없는 경우)
- 전문 지식을 환각 (Hallucinate) 하는 것
- 예시/튜토리얼을 대체하는 것 (Unlimited 모드 사용 권장)
- 도메인 경계를 넘나드는 작업
Sir Shortoken이 아닌 것:
- 새로운 모델이나 프레임워크가 아님
- 비판적 사고 (critical thinking)의 대체재가 아님
- 창의성이나 탐색을 위해 최적화되지 않음
- 비용 절감 도구 (비용 절감은 부수적인 효과임)
구현 방법 (Implementation)
- GitHub에서
skill.md를 복사합니다. - Claude, GPT, Gemini 또는 Ollama에 붙여넣습니다.
- 호출:
Sir Shortoken [budget]: [query] - 원장 (Ledger)을 확인합니다.
끝입니다. 어떤 LLM에서도 작동합니다.
여기서 흥미로운 점
AI 연구자들에게:
- 의미론적 압축 (Semantic compression)은 존재하며 측정 가능합니다.
- 제약 조건 강제 (Constraint enforcement)는 조용한 에스컬레이션을 방지합니다.
- 정보 예산 (Information budgets)은 예측 가능한 출력을 가능하게 합니다.
- 투명성 (원장을 통한)은 모델에 대한 신뢰를 구축합니다.
엔지니어를 위한 사항:
- 커스텀 모델 없이도 프런티어 모델 (Frontier models)을 제약할 수 있습니다.
- 강제 규칙 (Enforcement rules)을 통해 재현성 (Reproducibility)이 향상됩니다.
- 토큰 효율성 (Token efficiency)은 정보 밀도 (Information density)의 부수적인 효과입니다.
- 실행 증명 (Proof of execution, 원장/Ledger)을 통해 감사가 가능합니다.
제품 팀을 위한 사항:
- 이는 다른 도구들도 채택할 수 있는 패턴입니다.
- 사용자는 능력 (Capability)보다 절제 (Discipline)를 가치 있게 여깁니다.
- 주의력 (Attention)을 존중하는 것이 경쟁력입니다.
테스트 방법론 (Testing Methodology)
23개의 모든 테스트는 리포지토리 (Repo)에 문서화되어 있습니다. 다음과 같이 재현할 수 있습니다:
- 리포지토리 (Repo)를 클론 (Clone)합니다.
- Claude에서 skill.md를 활성화합니다.
- 각 테스트 케이스 (Test case)를 실행합니다.
- 기대 동작 (Expected behavior)과 비교합니다.
테스트 케이스는 다음을 포함합니다:
- 예산 진행 (Budget progression) (4개 테스트)
- 경계 준수 (Boundary respect) (4개 테스트)
- 지식 도메인 정확도 (Knowledge domain accuracy) (4개 테스트)
- 스트레스 테스트 (Stress testing) (4개 테스트)
- 일관성 (Consistency) (3개 테스트)
- 엣지 케이스 (Edge cases) (4개 테스트)
모두 통과했습니다. ✅
이것이 중요한 이유
프런티어 모델 (Frontier models)은 IDE, 브라우저, 채팅 인터페이스, API 등에서 주변 환경에 스며들고 있습니다 (Ambient).
도구가 어디에나 존재하게 될 때, 절제 (Discipline)는 가치 있는 것이 됩니다.
Sir Shortoken은 다음과 같은 것들이 가능하다는 것을 증명합니다:
- 모델의 지능을 떨어뜨리지 않고 출력을 제약하기
- 조용한 에스컬레이션 (Silent escalation) 방지
- 모델의 감사 가능성 (Auditable) 확보
- 사용자의 주의력 (Attention) 존중
- 시스템 프롬프트 (System prompt)만으로 구현 (커스텀 모델 불필요)
이는 채택할 가치가 있는 패턴입니다.
시도해보기
git clone https://github.com/shouvik12/sir-shortoken.git
cd sir-shortoken
cat skill.md
skill.md를 Claude 또는 사용 중인 LLM에 붙여넣으세요:
Sir Shortoken balanced: How does Git work?
원장 (Ledger)을 읽어보세요. 경계 (Boundary)를 준수하는지 확인하세요.
그런 다음 이 철학이 당신에게 중요한지 결정하십시오.
링크
- GitHub: https://github.com/shouvik12/sir-shortoken
- 테스트 케이스 (Test Cases):
/sir-shortoken-test-cases.md - 기술 정의 (Skill Definition):
/skill.md
태그: #ai #llm #claude #gpt #prompt-engineering #information-architecture #testing
토론하기: GitHub Issues
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기