LLM이 실제로 사고하도록 가르치는 방법론을 오픈 소스로 공개합니다
요약
LLM의 출력을 관찰 가능하고 진화 가능하게 만드는 '에이전틱 방법론(Agentic Method)' 오픈 소스가 공개되었습니다. 이 방법론은 관찰, 가설, 실험, 업데이트로 이어지는 엄격한 워크플로우를 통해 고위험 공학 및 연구 작업에 최적화된 자율 에이전트 시스템을 구축합니다.
핵심 포인트
- 단순 프롬프트를 넘어 관찰·반증·진화 가능한 워크플로우 제공
- 관찰-가설-실험-업데이트로 이어지는 증거 중심의 프로세스
- 고위험 공학 및 연구 작업을 위한 메타 프롬프트 및 프로토콜 포함
- 행동 전 컨텍스트 동결을 통한 엄격한 의사결정 강제
Agentic Method (에이전틱 방법론) — 단순한 프롬프트의 추가가 아니라, 모델의 출력을 관찰 가능(observable), 반증 가능(falsifiable), 진화 가능(evolvable)하게 만드는 워크플로우입니다.
GitHub logo Ghost-Silver / Agentic-MethodLLM을 개선하기 위한 에이전틱 프롬프트 시스템.
Agentic Method · 智能体方法论
License: MITPromptsExamplesMethodology엄격하고 증거 중심적인 자율 에이전트 방법론입니다.
관찰 → 가설 → 실험 → 관찰 업데이트 → 지식 업데이트
Observation → Hypothesis → Experiment → Observation Update → Knowledge Update이것은 무엇인가요?
Agentic Method는 고위험 공학, 연구 및 의사결정 작업을 대상으로 하는 메타 프롬프트(meta-prompts)와 서브 에이전트(sub-agent) 프로토콜의 집합입니다. 이는 가벼운 채팅 프롬프트 라이브러리가 아니라, 에이전트가 다음을 강제하도록 하는 워크플로우 시스템입니다:
- 행동하기 전에 컨텍스트를 동결(freeze context) 합니다.
- 단일 답변이 아닌 경쟁적 가설(competitive hypotheses) 을 생성합니다.
- 실험 전에 반증 가능한 정량적 예측(falsifiable quantitative predictions) 을 수행합니다.
- 결론만 내는 것이 아니라 관찰 및 판결(observation and verdict) 을 보고합니다.
- 실패를 기록(archive failures) 하고 세계 모델(world model)을 정직하게 업데이트합니다.
- 제어된 병렬 평가를 통해 자신의 프롬프트를 진화시킵니다.
설계 원리
현재의 중저가형 모델들은 이미 충분히 강력한 지시 이행 능력(instruction following capability) 을 갖추고 있지만, 고성능 모델에 비해 진정으로 뒤처지는 부분은 제로샷 추론 능력(zero-shot reasoning capability) 입니다. 그러나 고성능 모델조차 대규모 코드 개발이나 복잡한 과학 연구 문제에 직면하면 논리적 오류와 모델 환각(hallucination)을 피하기 어렵습니다.
Agentic Method는 다음과 같은 메커니즘을 통해 이 문제를 해결합니다:
- 엄격한 DSL 앵커링(DSL anchoring):
(CTX),(H),(EXP),(PREDICTION),(OBSERVATION),(VERDICT)등의 태그를 사용하여 모델의 디코딩 공간을 특정 작업 영역으로 제한함으로써 환각을 현저히 낮춥니다.- 강제적 심층 추론(forced deep reasoning): 모든 핵심 결론에는 반드시 신뢰도
(CONF)와 증거 등급이 수반되어야 하며, 모델은 표면적인 답변에 머무를 수 없습니다.- 서브 에이전트 교차 검토(sub-agent cross-review):
FORM_REVIEWER,HYPOTHESIS_VALIDATOR,COUNTEREXAMPLE_REVIEWER등의 역할을 통해 순환 논증, 숨겨진 가설, 사후 합리화를 식별합니다.- 연구 방법론 도입: 반사실적 추론(counterfactual reasoning), 이분법적 실험(dichotomy experiment), 어블레이션 실험(ablation study), 대조 실험(control experiment), 사고 실험(thought experiment) 등의 방법론이 워크플로우에 명시적으로 포함되어 모델이 고차원적인 사고를 하도록 강제합니다.
본질적으로, 우리는 모델을
- On-demand Loading (按需加载): Agent가 한 번에 모든 프롬프트(prompt)를 로드하게 하지 마세요. 먼저
main.md를 읽게 한 다음, 현재 작업 유형에 따라 해당하는 핵심 프롬프트를 로드하도록 합니다.- Scheduled Evolution (定时进化): 매일 유휴 시간에
prompt-evolution-prompt.md를 실행하여 기존 프롬프트에 대해 PEL 반복(iteration)을 수행합니다.우수한 프롬프트의 지원을 받는다면, 중간 규모의 모델(mid-range model)도 특정 하위 작업(sub-task)에서는 더 상위 모델에 근접하거나 심지어 대등한 성능을 낼 수 있습니다.
추천 워크플로우
Step 1: Agent가 main.md를 읽고, 전역 프로토콜(global protocol)과 사용 가능한 프롬프트 디렉토리를 이해함 ↓ Step 2: 사용자가 명령을 전달함…
문제는 점점 명확해지고 있습니다
오늘날의 LLM — 특히 중간 규모 모델들은 — 이미 강력한 **지시 이행 능력 (instruction-following abilities)**을 갖추고 있습니다. 출력 형식을 지정하거나, 단계를 따르거나, 도구(tool)를 호출하라고 요청하면 대부분 잘 따릅니다.
하지만 작업이 복잡해지는 즉시 — 여러 파일에 걸친 코드 변경 사항 검토, 통제된 실험 설계, 또는 시스템 버그의 근본 원인에 대한 추론 등 — 모델은 두 가지 특징적인 방식으로 실패하는 경향이 있습니다:
- 환각 (Hallucination): 근거 없이 확신을 가지고 결론을 진술함.
- 사후 합리화 (Post-hoc rationalization): 먼저 답으로 건너뛴 다음, 나중에 그럴듯한 추론 과정(가짜 CoT)을 꾸며냄.
문제는 모델이 충분히 "똑똑하지 않아서"가 아닙니다. 문제는 모델의 디코딩 공간 (decoding space)이 너무 제약이 없다는 것입니다. 외부적인 스캐폴딩 (scaffolding) 없이는, 모델을 "올바른 추론"의 궤도에 고정할 수 있는 장치가 없습니다.
우리의 접근 방식: 방법론을 통한 디코딩 공간의 제약
Agentic Method는 단순한 프롬프트의 모음이 아닙니다. 이는 네 가지 메커니즘을 통해 모델의 추론 과정을 외재화(externalize), 구조화(structure), 그리고 감사(audit)하는 **메타 워크플로우 (meta-workflow)**입니다.
1. 엄격한 DSL 앵커링 (Strict DSL Anchoring)
(CTX),(H),(PREDICTION),(OBSERVATION),(VERDICT)와 같은 태그는 모델이 모든 중요한 단계에서 다음 사항을 선언하도록 강제합니다:
- 현재 컨텍스트 (context)는 무엇인가?
- 가설 (hypothesis)은 무엇인가?
- 반증 가능한 예측 (falsifiable prediction)은 무엇인가?
- 실제로 관찰된 것 (observation)은 무엇인가?
- 최종 판결 (verdict)은 무엇인가?
이를 통해 출력물은 자유 형식의 산문에서 구조화된 과학적 기록으로 변하며, 환각 현상이 극적으로 감소합니다.
2. 강제된 심층 추론 (Forced Deep Reasoning)
모든 핵심 결론은 반드시 다음을 포함해야 합니다:
- 증거 등급 (Evidence grade, F0-F4)
- 신뢰도
(CONF: <level>, <evidence summary>) - 최소 하나 이상의 대립 가설
(BRANCH) - 명시적인 반증 조건
(FALSIFICATION)
더 이상의 피상적인 답변은 허용되지 않습니다.
3. 서브 에이전트 교차 검토 (Sub-Agent Cross-Review)
FORM_REVIEWER, HYPOTHESIS_VALIDATOR, COUNTEREXAMPLE_REVIEWER와 같은 역할(Roles)을 통해 에이전트들이 서로를 감사(Audit)하게 합니다. 순환 논리, 숨겨진 가정, 그리고 사후 합리화(Post-hoc rationalizations)가 명시적으로 탐지됩니다.
4. 내장된 과학적 방법론 (Embedded Scientific Method)
이분법(Bisection), 절제 실험 (Ablation), 통제 실험 (Controlled experiments), 그리고 반사실적 추론 (Counterfactual reasoning)은 단순히 문서상의 제안 사항이 아닙니다. 이는 프롬프트에 내장된 **건너뛸 수 없는 단계 (Non-skippable steps)**입니다.
고위험 과업을 위한 30가지 핵심 프롬프트 (30 Core Prompts for High-Stakes Tasks)
해당 저장소(Repo)에는 민감한 정보가 제거된 재사용 가능한 30가지 핵심 프롬프트가 포함되어 있습니다:
experimental-design-prompt.md— 검증 가능한 실험 설계logical-inference-prompt.md— 엄격한 논리적 추론 및 증명 검토code-review-prompt.md— 체계적인 코드 리뷰debug-prompt.md— 인과적 진단 및 수정performance-optimization-prompt.md— 성능 결정 프로토콜prompt-evolution-prompt.md— 프롬프트가 스스로 진화하도록 유도subagent-protocol.md— 18가지 서브 에이전트 역할을 위한 프로토콜- ...외 다수
모든 프롬프트는 동일한 DSL (Domain-Specific Language)을 공유하며, 필요에 따라 로드, 조합 및 진화가 가능합니다.
프롬프트 진화 루프 (Prompt Evolution Loop, PEL)
아마도 가장 흥미로운 부분은 **프롬프트 진화 루프 (Prompt Evolution Loop, PEL)**일 것입니다.
아이디어는 간단합니다: 시드 프롬프트(Seed prompt)를 가져와 여러 개의 변이된 변체(Mutated variants)를 생성하고, 동일한 실제 과업 세트에서 이들을 병렬로 평가한 뒤, 가장 적합한 것들을 유지하는 것입니다.
저희의 예시 보고서는 실제 PEL 실행 사례 하나를 보여줍니다:
CONSTRAINT_ADD변이는 P0 프로토콜 일관성 결함을 수정했습니다.ANTI_PATTERN_BLOCK변이는 기존 규칙과 충돌했기 때문에 폐기되어야 했습니다.EXAMPLE_INJECT변이는 예시가 구체적인 체크리스트 항목에 결합되었을 때만 작동했습니다.
이러한 발견 그 자체가 프롬프트 엔지니어링 (Prompt Engineering)이 연금술에서 실험 과학으로 넘어갈 수 있다는 증거입니다.
권장 설정 (Recommended Setup)
이 방법론은 높은 리스크가 따르는 작업 (high-stakes tasks)을 위해 설계되었으며, 더 많은 토큰과 컨텍스트 (context)를 소비합니다. 하지만 저희는 그만한 가치가 있다고 믿습니다.
- 메인 에이전트 / 오케스트레이션 (Main agent / orchestration): 200B+ 파라미터, 200K+ 컨텍스트 윈도우 (context window)
- 서브 에이전트 / 리뷰 레이어 (Sub-agent / review layer): 더 저렴한 중간 크기의 모델들
- 실행 방법: 먼저
main.md를 읽은 다음, 현재 작업에 맞는 프롬프트만 로드하세요.
도움이 되는 분야
- 복잡한 코드 리뷰 및 아키텍처 결정
- 근본 원인 (Root-cause) 버그 진단
- 성능 최적화 실험 설계
- 과학적 논증 및 기술 조사
- 잘못된 진술의 비용이 큰 모든 작업
오픈 소스, MIT 라이선스
저희는 이 방법론이 더 많은 도메인에서 검증되고, 개선되며, 적용되기를 바랍니다.
만약 여러분이:
- 소프트웨어 엔지니어링이나 연구 이외의 도메인에 이를 적용하거나;
- PEL을 통해 더 나은 프롬프트 변형을 발전시키거나;
- 어떤 프롬프트에서 결함을 발견한다면;
GitHub에 이슈 (Issue) 또는 풀 리퀘스트 (PR)를 올려주세요. 커뮤니티가 도메인 특화 어댑터 (domain-specific adapters)와 베스트 프랙티스 (best practices)를 함께 축적해 나갈 것입니다.
다음 단계 (Next Steps)
- 레포지토리 열기:
GitHub logo Ghost-Silver / Agentic-Method
LLM 성능 향상을 위한 에이전트적 프롬프트 시스템.
Agentic Method · 에이전트 방법론
엄격하고 증거 기반의 자율 에이전트 방법론입니다.
관찰 → 가설 설정 → 실험 → 관찰 업데이트 → 지식 업데이트
Observation → Hypothesis → Experiment → Observation Update → Knowledge Update
이것은 무엇인가요?
Agentic Method는 고위험 엔지니어링, 연구 및 의사결정 작업을 위한 일련의 메타 프롬프트(meta-prompts)와 서브 에이전트 프로토콜입니다. 이는 가벼운 채팅 프롬프트 라이브러리가 아니라, 에이전트가 다음을 강제하는 워크플로우 시스템입니다:
- 행동하기 전에 컨텍스트를 고정합니다.
- 단일 답변이 아닌 경쟁적인 가설을 생성합니다.
- 실험 전에 반증 가능한 정량적 예측을 수행합니다.
- 결론만 보고하는 것이 아니라 **관찰 및 판결(verdict)**을 보고합니다.
- 실패 사례를 기록하고 월드 모델을 정직하게 업데이트합니다.
- 제어된 병렬 평가를 통해 자신의 프롬프트를 진화시킵니다.
설계 원리
현재의 중저가급 모델들은 충분히 강력한 **지침 준수 능력(instruction following ability)**을 갖추고 있지만, 실제로 고급 모델에 비해 뒤처지는 부분은 **제로샷 추론 능력(zero-shot reasoning ability)**입니다. 그러나 아무리 고급 모델이라도 대규모 코드 개발이나 복잡한 과학적 문제에 직면할 때 논리적 오류나 모델 환각(model hallucination)을 일으키기 쉽습니다.
Agentic Method는 다음 메커니즘을 통해 이 문제를 해결합니다:
- 엄격한 DSL 앵커링:
(CTX)(컨텍스트),(H)(가설),(EXP)(실험),(PREDICTION)(예측),(OBSERVATION)(관찰),(VERDICT)(판결) 등의 태그를 사용하여 모델의 디코딩 공간을 특정 작업 영역에 제약함으로써 환각 현상을 크게 낮춥니다. - 강제적인 심층 추론: 모든 핵심 결론은 신뢰도
(CONF)와 증거 등급을 첨부해야 하며, 모델이 피상적인 답변에 머무를 수 없게 합니다. - 서브 에이전트 교차 검토:
FORM_REVIEWER,HYPOTHESIS_VALIDATOR,COUNTEREXAMPLE_REVIEWER등의 역할을 통해 순환 논증, 숨겨진 가설, 사후 합리화를 식별합니다. - 과학적 방법론 도입: 반사실 추론(counterfactual reasoning), 이분 실험(binary experiment), 제거 실험(ablation experiment), 통제 실험(control experiment), 사고실험(thought experiment) 등의 방법론이 워크플로우에 명시적으로 내장되어 모델이 고차원적인 사고를 하도록 강제합니다.
본질적으로, 우리는 모델을 '더 똑똑하게' 만드는 것이 아니라, 모델의 사고 과정을 더 관찰 가능하고, 반증 가능하며, 감사 가능한(auditable) 상태로 만듭니다.
모델 요구사항 및 비용 전략
추천 구성
본 프로토콜의 복잡한 작업(특히 다중 파일 코드 검토, 아키텍처 결정, 장쇄 인과 추론이 관련된 경우)을 완벽하게 실행하려면 다음을 권장합니다:
- 파라미터 수: 200B 이상
- 컨텍스트 창: 200K 이상
- 능력: 강력한 지침 준수, 긴 컨텍스트 안정성, 도구 호출 지원 (서브 에이전트용)
비용 절감 핵심 전략
본 프로토콜은 많은 토큰과 컨텍스트를 소모하지만, 이러한 소모는 작업 품질 향상에 매우 현저합니다. 최적의 방법론은 필요할 때 로드 + 모델 라우팅입니다:
-
메인 에이전트 / 오케스트레이션 계층: 가장 강력한 모델을 사용하여 작업 분해, 가설 생성, 최종 판결을 담당합니다.
-
서브 에이전트 / 검토 계층: 더 저렴한 모델을 사용하여 형식 검토, 가설 검증, 반례 구성 등의 하위 작업을 담당합니다.
-
온디맨드 로딩 (On-demand loading): 에이전트가 한 번에 모든 프롬프트 (Prompt)를 로드하게 하지 마세요. 먼저
main.md를 읽게 한 다음, 현재 작업 유형에 따라 해당하는 핵심 프롬프트를 로드하도록 합니다.- 정기적 진화 (Scheduled evolution): 매일 유휴 시간에
prompt-evolution-prompt.md를 실행하여 기존 프롬프트에 대해 PEL 반복을 수행합니다.
훌륭한 프롬프트 (Prompt)의 지원을 받으면, 중간 규모의 모델 (Medium-sized model)도 특정 하위 작업에서 더 상위 모델에 근접하거나 심지어 대등한 성능을 낼 수 있습니다.
추천 워크플로우 (Workflow)
Step 1: 에이전트 (Agent)가 main.md를 읽고, 전체 프로토콜과 사용 가능한 프롬프트 (Prompt) 디렉토리를 이해함 ↓ Step 2: 사용자가 명령을 내림…
- 정기적 진화 (Scheduled evolution): 매일 유휴 시간에
core/master-prompt.md로 시작하세요.- 현재 어려움을 겪고 있는 어려운 작업을 선택하고,
experimental-design-prompt.md또는debug-prompt.md를 시도해 보세요. - 효과가 있다면 ⭐를 눌러주거나 사용 사례를 공유해 주세요.
이것은 또 다른 프롬프트 (Prompt) 저장소가 아닙니다. 이것은 LLM이 과학자처럼 생각하도록 가르치는 워크플로우 (Workflow)입니다.
GitHub logo Ghost-Silver / Agentic-Method
LLM을 개선하기 위한 에이전트 기반 프롬프트 시스템 (Agentic Prompt System).
Agentic Method · 에이전트 방법론
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기