Anthropic이 Claude Code의 system prompt를 80% 제거한 이유: 모델이 똑똑해질수록 더 적은 지침과 제약이 필요하다
요약
Anthropic은 Claude Code의 system prompt를 80% 제거하여 모델의 성능을 향상시켰습니다. 모델의 추론 능력이 높아질수록 과도한 예시와 제약은 오히려 성능을 저해하므로, 최소한의 원칙과 자기 수정 루프 중심의 아키텍처 설계가 필요합니다.
핵심 포인트
- 모델이 똑똑해질수록 적은 지침과 제약이 더 높은 성능을 유도함
- 과도한 퓨샷 예시는 모델의 창의성을 제한하고 주의력을 분산시킴
- 에이전트 설계 패러다임을 무거운 매뉴얼에서 자율적 탐험가 모델로 전환해야 함
- 컨텍스트 다이어트와 검증 레이어 강화를 통해 에이전트 효율성 극대화 가능
Anthropic은 Claude Code의 system prompt를 80% 제거했습니다. 팀원 Thariq의 설명은 매우 반직관적입니다. 모델이 똑똑해질수록 더 적은 방향성, 더 적은 제약, 더 적은 예시가 필요하다는 것입니다.
그 예시들이 오히려 모델을 제한하고 있었습니다. 모델은 사용자가 예시와 똑같은 것을 원한다고 생각하기 때문입니다. 예시를 제거하면 모델은 오히려 더 자유로워집니다.
이는 새로운 모델이 출시될 때마다 당신이 가장 먼저 해야 할 일이 컨텍스트 (context)를 다듬는 것임을 의미합니다.
최신 모델은 더 많은 실행 공간이 필요합니다. 그들은 직관적인 비교를 제공했습니다. 12.8MB로 컨텍스트 윈도우 (context window)의 95%를 가득 채운 비대한 CLAUDE.md가,
2.1MB로 다이어트하여 18%만 차지하게 되었을 때, 모델의 집중도가 오히려 좋아지고 결과도 더 우수해졌습니다.
이것은 단순한 프롬프트 (prompt) 기술의 반복이 아니라, 인지 아키텍처 (cognitive architecture)의 패러다임 전환입니다.
초기 모델은 초보자와 같아서 정렬 (alignment)을 위해 대량의 퓨샷 (few-shot) 예시와 상세한 제약 조건이 필요했습니다.
하지만 모델의 추론 (reasoning) 능력이 크게 도약하면서, 그 예시들은 비계 (scaffolding)가 아닌 족쇄가 되었습니다.
모델은 문제 공간 (problem space)을 진정으로 이해하기보다 예시를 모방하려는 경향이 있습니다. 또한 아무리 똑똑한 모델이라도 저밀도의 중복 정보로 가득 채우면 주의력 희석 (attention dilution)이 발생합니다.
다이어트 후 모델은 정말 중요한 토큰 (token)에 더 많은 연산력을 사용하게 되어 오히려 효과가 상승했습니다. 이는 인간이 정보 과부하로 인해 의사결정 능력이 저하되는 것과 매우 유사합니다.
에이전트 (Agent) 구축의 근본적인 전환이 바로 여기에 있습니다. 구식 패러다임은 무거운 system prompt에 대량의 예시와 복잡한 워크플로우 (workflow) 정의를 더하는 것이었습니다.
모델이 원격 제어를 받는 실행자 같았다면, 새로운 패러다임은 최소한의 핵심 원칙과 명확한 목표, 강화된 검증 및 자기 수정 (self-correction) 루프, 그리고 모듈화된 기술을 더하는 것입니다.
모델이 권한을 부여받은 탐험가처럼 작동하게 됩니다. Thariq가 언급한 장기 실행 메커니즘과 커뮤니티에서 누군가가 10시간 이상 연속 실행에 성공한 사례가 이를 뒷받침합니다.
핵심은 더 긴 프롬프트를 쓰는 것이 아니라, 검증과 자기 수정 능력을 프롬프트가 아닌 아키텍처 (architecture) 안에 구축하는 것입니다.
AI에게 두꺼운 운영 매뉴얼과 수십 개의 사례집을 주면, AI는 지침을 따라 안전하게 움직이지만 평범한 결과에 그칩니다.
하지만 명확한 북극성(목표)과 나침반, 그리고 자기 수정 레이더를 준다면, AI는 자유롭게 탐색하되 경로를 이탈했을 때 스스로 발견하고 수정할 수 있습니다.
매뉴얼이 두꺼울수록 AI는 숙련공처럼 보이기는 쉽지만 숙련공의 직관을 갖기는 어렵습니다. 매뉴얼을 제거해야만 비로소 진정한 문제 공간에 대한 직관을 발전시킬 기회를 얻습니다.
이는 에이전트 시스템을 구축하고 있는 사람들에게 명확한 행동 신호입니다.
첫째, 즉시 컨텍스트 감사 (context audit)를 실시하십시오.
현재 주요 에이전트의 system prompt를 꺼내어 어떤 것이 유산(legacy) 예시인지, 과도한 제약인지 표시하십시오. 그리고 과감하게 절반 이상을 쳐내고 효과를 관찰하십시오.
둘째, 빈도가 높은 반복 작업은 독립된 기술 파일로 추출하여, 전체 매뉴얼을 항상 들고 다니는 대신 필요할 때만 로드(load)하게 하십시오.
셋째, 검증 레이어 (verification layer)를 강화하십시오. 에이전트가 계획만 출력하게 두지 마십시오.
먼저 스스로 계획을 비판(critique)하게 하고, 그 다음 당신이나 메타 에이전트 (meta-agent)가 리뷰하게 하십시오.
넷째, 새로운 모델이 출시될 때마다 체계적으로 컨텍스트를 다듬고 핵심 워크플로우를 다시 테스트하십시오.
다섯째, '실행을 위한 공간 (room to run)'을 설계 원칙으로 삼으십시오. 에이전트 오케스트레이션 (orchestration)에서 명령 실행의 단방향 흐름이 아닌, 탐색-검증-수정의 폐쇄 루프 (closed loop)를 명시적으로 설계하십시오.
모델이 자유로워질수록 분산(variance)은 커집니다. 장점은 창의성과 문제 해결 능력이 향상된다는 것이고, 단점은 당신이 진정으로 원하는 방향에서 벗어날 수 있다는 것입니다.
이는 당신의 취향(taste)과 판단력이 약화되는 것이 아니라, 더 핵심적인 메타 레이어 (meta-layer)로 업그레이드되어야 함을 의미합니다. 모델이 자유로워질수록 당신은 더 높은 품질의 문지기 (gatekeeper)가 되어야 합니다.
작년의 헤비 프롬프팅 (heavy prompting) 사고방식으로 올해의 모델을 쌓아 올리려 한다면 점점 더 힘들어질 뿐입니다.
모델이 똑똑해질수록 어떻게 하는지 덜 가르치고, 어떻게 할지 발견할 수 있는 공간을 더 많이 주어야 합니다.
동시에 자신의 판단력을 더 강하게 구축하십시오. 이것이 진정한 레버리지 (leverage) 업그레이드입니다. 영상은 중영 자막을 포함하여 제작되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @ayi_ainotes (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기