로컬 코딩 에이전트용으로 30K 토큰 시스템 프롬프트를 사용하는 것을 중단하세요. Ollama / llama.cpp를 사용하면 일반 Git
요약
로컬 코딩 모델(Qwen, DeepSeek, Llama 3 등)을 Ollama나 llama.cpp 같은 도구로 실행할 때, 대규모 시스템 프롬프트 사용은 비효율적입니다. 대신, 컨텍스트는 사람이 읽고 Git으로 버전 관리되는 Markdown 파일 형태로 로컬에 저장하는 것이 권장됩니다.
핵심 포인트
- 30K 토큰의 시스템 프롬프트 사용을 지양해야 합니다.
- 로컬 환경에서는 KV 캐시 및 TTFT 페널티가 발생합니다.
- 영구적인 상태(Durable state)는 Git으로 관리되는 Markdown 파일에 보관하세요.
- 아키텍처 규칙과 API 계약은 불변의 Markdown 파일(.canonical.md)로 유지해야 합니다.
만약 로컬 코딩 모델(Qwen 2.5/3.8 Coder 14B/27B/32B, DeepSeek 또는 Llama 3을 Ollama, llama.cpp 또는 vLLM을 통해 실행한다면), 여러분은 이미 로컬 하드웨어에서 에이전트 코딩의 두 가지 치명적인 병목 현상을 알고 있습니다:
KV 캐시 및 TTFT 페널티: 클라우드 사용자는 생각 없이 Claude Opus에게 50,000 토큰 분량의 채팅 기록을 던집니다. 로컬 24GB 또는 32GB 장비에서 30K 토큰에 달하는 노이즈가 많은 대화 기록을 미리 채우는 것은 Time to First Token (TTFT)을 바닥으로 끌어내리고, 컨텍스트 창에 속해야 할 귀중한 VRAM을 소모하며,
영구적인 상태(Durable state)는 사람이 읽을 수 있고, git 버전 관리된 Markdown 파일 형태로 NVMe SSD에 보관되어야 합니다:
[ 로컬 머신: 일반 Git 버전 관리 Markdown ]
├── .context/CANONICAL.md <-- 불변의 아키텍처 규칙 및 API 계약
├── .context/memory_bank/ <-- activeContext.md & 세션 체크포인트
├── .agent/workflows/ <-- 결정론적 슬래시 명령어 (/start, /end, /plan)
├── .agent/skills/ <-- 온디맨드(on-demand)로 엄격하게 로드되는 도메인 기능
└── .agent/scripts/ <-- 검증 테스트 러너 및 린터 후크
제출자: /u/BangMyPussy
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기