
실행형 AI 시대의 자동화: Claude Opus 5와 ChatGPT Work로 만드는 「태스크 완수」 에이전트 구현 패턴
요약
실행형 AI(Agentic AI) 시대에 맞춰 목표 정의, 계획 분해, 도구 실행, 검증 루프의 4레이어 아키텍처를 통해 태스크를 완수하는 에이전트 구현 패턴을 소개합니다. Claude Opus 5와 ChatGPT Work를 활용하여 단순 답변을 넘어 실제 업무를 자동화하는 구체적인 코드 예시와 전략을 다룹니다.
핵심 포인트
- 실행형 AI의 핵심은 4레이어(Goal, Plan, Act, Verify) 구조에 있음
- 검증(Verify) 루프를 통한 자기 피드백이 업무 품질을 결정하는 핵심 요소
- Claude Opus 5를 활용한 목표 주도형 태스크 분해 및 도구 실행 패턴 구현
- 업계 지식을 규칙(Rule)으로 주입하여 범용 AI 이상의 품질 확보 가능
서론
2026년 7월, AI의 주전장은 「똑똑하게 대답하기」에서 「업무를 완수하기」로 옮겨갔습니다. 최근 3주간의 움직임이 이를 상징합니다.
Claude Opus 5 (7/24) — 이전 세대인 Opus 4.8과 동일한 가격으로 최상위 Fable 5에 육박하는 성능 -
OpenAI GPT-5.6 + ChatGPT Work (7/9) — 몇 시간 동안 붙어있으며 목표를 완성물로 바꾸는 에이전트 -
Gemini 4 (7/21) — 사전 학습(Pre-training) 시작 -
본 기사에서는 이러한 실행형 AI (agentic AI)를 단발성 채팅이 아닌 「태스크를 끝까지 끝내는 파이프라인」으로 구축하는 구현 패턴을 코드와 함께 정리합니다.
실행형 AI의 구조: 4레이어
「대답하는 AI」와 「끝내는 AI」의 차이는 아키텍처로 구현하면 명확합니다.
Goal (목표 정의) — 무엇을 완성할 것인가 -
Plan (계획 분해) — 목표를 서브 태스크(Sub-task)로 분해 -
Act (도구 실행) — 각 서브 태스크를 외부 도구/API로 실행 -
Verify (검증) — 결과물이 기준을 충족하는지 자기 검증하고, 미달 시 루프(Loop) 실행 -
포인트는 4번의 검증 루프입니다. 이 부분이 「떠넘기기식 저품질 업무」와 「사용 가능한 자동화」를 가르는 경계선입니다.
패턴 1: 목표 주도형 태스크 분해
목표를 받아 서브 태스크로 분해합니다. Claude Messages API의 예시입니다.
import anthropic, json
client = anthropic.Anthropic()
def decompose_goal(goal: str) -> list[str]:
msg = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
system="목표를 실행 가능한 3~6개의 서브 태스크로 분해하여 JSON 배열만 반환하라",
messages=[{"role": "user", "content": f"목표: {goal}"}],
)
return json.loads(msg.content[0].text)
## 패턴 2: 도구 실행 (tool use)으로 직접 움직이기
분해만 해서는 「대답하는 AI」의 영역을 벗어날 수 없습니다. 실제로 움직이려면 tool use가 필요합니다.
```python
tools = [{
"name": "fetch_url",
"description": "지정된 URL의 텍스트 내용을 가져온다",
...
이 루프를 계속 돌림으로써, AI가 스스로 「다음에 무엇을 호출할지」 판단하며 작업을 진행합니다. ChatGPT Work가 「앱을 넘나들며 몇 시간 동안 작동하는」 내부 원리가 바로 이것입니다.
패턴 3: 검증 루프 (이것이 본질)
실행형 AI의 품질을 결정하는 것은 검증입니다. 결과물을 별도의 프롬프트로 채점하고, 기준 미달 시 다시 만들게 합니다.
def verify_and_retry(goal, output, max_retries=2):
for _ in range(max_retries + 1):
check = client.messages.create(
...
사람이 하던 「품질 체크와 반려」를 코드로 구현하는 이미지입니다. 여기에 당신의 업계 지식을 규칙(Rule)으로서 주입할 수 있다면, 범용 AI는 낼 수 없는 품질을 얻을 수 있습니다. 이것이 「업계 지식 × AI 활용 능력」의 구현적인 의미입니다.
모델 선정 지침 (2026년 7월 기준)
| 용도 | 권장 | 이유 |
|---|---|---|
| 분해·검증 등 사고의 핵심 | Claude Opus 5 | 이전 세대와 동일 가격으로 고성능, 추론이 안정적 |
| ... | 비용 설계의 핵심은 「사고의 핵심은 고성능 모델, 단순 처리는 저가형 모델」로 역할을 분담하는 것입니다. |
요약
- 2026년 후반의 AI는 「대답하기」에서 「완수하기」로 이행했다
- 실행형 AI는 Goal → Plan → Act → Verify의 4개 층으로 구성한다
- 품질을 결정하는 것은 검증 루프. 여기에 업계 지식을 주입한다
- 모델은 역할 분담을 통해 비용을 최적화한다
- 「자동화 도구 구축」은 재현성이 높은 부업 장르다. 검증 로직이 차별화 요소가 된다
우선 작은 목표 하나를 정해, 이 4개 층을 돌리는 미니멀한 스크립트를 작성해 보는 것을 추천합니다.
### Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기