
클릭을 멈추고 확장을 시작하는 방법: AI 에이전트가 비즈니스 전략을 실행하게 하세요!
요약
단순한 텍text 생성을 넘어 브라우저를 직접 제어하여 비즈니스 프로세스를 실행하는 AI 에이전트 구축 방법을 소개합니다. 멘토링 데이터와 같은 컨텍스트를 활용해 반복 가능한 커스텀 기술(SOP)로 전환하고 자동화하는 전략을 다룹니다.
핵심 포인트
- 단순 챗봇 활용을 넘어 브라우저를 구동하는 AI 에이전트 구축 필요성
- 대화 전사 데이터를 활용한 커스텀 AI 기술(SOP) 전환 전략
- 멀티 LLM(OpenAI, Google, Claude)을 결합한 AI 하네스 활용법
- AI를 통한 고부가가치 비즈니스 프로세스 자동화의 미래
챗봇에 토큰을 낭비하는 것을 멈추세요. 브라우저를 실제로 구동하는 커스텀 AI 기술 (AI skills)을 구축하는 방법은 다음과 같습니다.
비즈니스 코칭에 대한 냉혹한 진실이 하나 있습니다. 대부분의 사람들은 멘토에게 수천 달러를 지불하고, 수많은 노트를 작성하지만, 그중 단 하나도 실행하지 않습니다.

좋은 조언을 얻는 것과 실제로 업무를 수행하는 것 사이의 격차는 대부분의 비즈니스가 정체되는 지점입니다. 전략 회의를 마치고 나면 CRM에서 변경해야 할 15가지 사항, 구축해야 할 5개의 새로운 아웃리치 캠페인 (outreach campaigns), 그리고 설정해야 할 3개의 소프트웨어 도구 목록을 받게 됩니다.
이는 압도적입니다. 그래서 저는 수동으로 처리하려는 시도를 멈췄습니다.
대신, 저는 멘토와의 대화를 녹음하고 그 원본 전사 데이터 (transcript)를 AI "하네스 (harness)"의 컨텍스트 (context)로 사용합니다. 하지만 여기서 결정적인 차이점이 있습니다. 저는 단순히 AI에게 일회성 작업을 요청하는 것이 아닙니다. 저는 AI를 사용하여 그 조언을 커스텀 기술 (custom skill), 즉 반복해서 실행할 수 있는 자동화된 표준 운영 절차 (SOP, Standard Operating Procedure)로 전환합니다. 그런 다음, AI 에이전트 (AI agents)가 브라우저를 구동하여 이를 실행하도록 합니다.
만약 여러분이 **AI 비즈니스 프로세스 자동화 (AI business process automation)**를 살펴보고 있다면, 이것이 바로 최전선입니다. 우리는 AI가 단순히 텍스트를 생성하는 단계를 넘어, AI가 실제로 클릭을 수행하는 시대로 진입하고 있습니다. 하지만 오해하지 마세요. AI가 당신을 대체하는 것이 아닙니다. 당신이 그 지능을 가이드하는 것입니다. 미래의 진정한 기술은 고부가가치 과업을 완수하기 위해 그 지능을 활용하는 능력입니다.
다음은 제가 멀티 LLM 하네스 (multi-LLM harness)와 **비즈니스용 AI 에이전트 (AI agents for business)**를 사용하여 자율적인 멘토십 루프를 구축한 정확한 방법입니다.
_"미래의 진정한 기술은 AI에게 프롬프팅 (prompting)을 하는 것이 아닙니다. 그것은 지능을 활용하여 고부가가치 과업을 대규모로 완수하는 능력입니다."
📖 용어 사전 (Glossary of Terms)
- AI Harness (AI 하네스): 저는 OpenAI, Google, Claude의 구독 서비스를 구매하여 이들을 함께 사용함으로써 복잡한 정보를 처리하고 전략을 추출합니다. 이를 전체 운영을 위한 '두뇌'라고 생각하십시오.
- AI Agent (AI 에이전트 / Agentic Automation (에이전트적 자동화)): 단순히 텍스트를 생성하는 것에 그치지 않고, 웹 브라우저를 능동적으로 "구동"할 수 있는 AI입니다. 에이전트는 인간처럼 화면을 보고, 버튼을 클릭하고, 타이핑하며, 소프트웨어를 탐색할 수 있습니다.
- AI Skill (AI 스킬 / SOP (표준 운영 절차)): 하네스(Harness)에 의해 생성되어 AI 에이전트가 요청 시 즉시 실행할 수 있는 반복 가능한 일련의 지침(Standard Operating Procedure)입니다.
지식-실행 격차 (The Knowledge-Execution Gap)
현재 **AI 워크플로우 자동화 (AI workflow automation)**의 지형을 살펴보면, 모두가 코드, 카피, 이미지 등을 "]생성"하는 데 AI를 사용하는 것에 대해 이야기하고 있습니다.
하지만 생성은 실행이 아닙니다. 진정한 돌파구는 **에이전트적 웹 자동화 (Agentic Web Automation)**에 있습니다.
이는 취약하고 정적인 스크립트(기존의 Zapier 플로우와 같은)에서 사용자 인터페이스(UI)에 대해 "추론"할 수 있는 AI 에이전트로의 전환을 의미합니다. 에이전트는 브라우저 상태를 관찰하고, 다음 동작(클릭, 타이핑, 스크롤)을 결정하며, 웹사이트가 변경될 경우 스스로를 복구합니다.
고차원적인 전략 호출의 맥락을 에이전트적 브라우저에 직접 연결함으로써, "실행 격차 (Execution Gap)"를 완전히 제거할 수 있습니다. AI는 단순히 할 일 목록을 제공하는 것이 아니라, 그것을 직접 실행합니다.
자율적 멘토십 루프의 아키텍처 (The Architecture of the Autonomous Mentorship Loop)

(만약 여러분이 클릭을 멈출 수 있도록 Why57의 저희 팀이 귀하의 비즈니스를 위한 바로 이 두뇌를 구축해주길 원하신다면, 저희의 무료 ROI 계산기(ROI Calculator)를 여기에서 확인하십시오.)
1단계: 컨텍스트 레이어 (The Context Layer / 멀티 LLM 하네스)
자, 핵심은 이렇습니다. 모든 것은 녹음에서 시작됩니다. 저는 멘토와의 통화 녹취록을 가져와 저의 AI 하네스 (AI harness)에 입력합니다. 저는 단 하나의 모델에만 의존하지 않습니다. 세 개의 주요 제공업체인 OpenAI (현재 월 100달러 플랜 사용 중), Google, 그리고 Claude의 구독을 모두 결제하여 사용합니다. 저는 이 모든 토큰 (tokens)을 활용하여 이 작업을 수행합니다. 이 하네스는 저의 전략 분석가 역할을 하며, 전체 워크플로 (workflow) 전반에 걸쳐 가능한 최상의 추론 (reasoning), 데이터 추출 (data extraction), 그리고 창의적인 결과물을 제공합니다.
저는 하네스에게 요약을 요청하지 않습니다. 대신 실행 계획 (execution plan)을 요청합니다.
"당신은 나의 기술 공동 창업자 (technical co-founder)입니다. 이 멘토 통화 녹취록을 검토하세요. 멘토가 나에게 준 모든 구체적이고 실행 가능한 권장 사항을 추출하세요. 각 권장 사항을 단계별 브라우저 워크플로 (browser workflow)로 세분화하세요."
2단계: "기술 (Skill)"의 프로토타이핑 및 경화 (Hardening)
AI를 제 브라우저에 풀어놓기 전에, 저는 AI에게 해당 작업을 정확히 어떻게 수행해야 하는지 훈련시켜야 합니다. 곧바로 영구적인 자동화로 뛰어드는 것이 아닙니다.
이 워크플로를 매우 강력하게 만드는 점은 바로 이것입니다. 바로 반복적 (iterative)이라는 점입니다.
먼저, 저는 방금 나눈 대화를 바탕으로 하네스가 플로 (flow)를 프로토타이핑하도록 합니다. 예를 들어, 작업이 "정부 계약 건을 스크래핑하고 내 말투로 아웃리치 (outreach) 이메일을 예약하는 것"이라고 가정해 봅시다. 저는 하네스에게 이 작업을 딱 한 번 수행하도록 요청합니다.
그다음 출력물을 검토합니다. 톤 (tone)이 적절했나요? RFP (제안요청서)에서 올바른 데이터를 가져왔나요?
테스트를 거쳐 결과가 실제로 좋다는 것을 확인하고 나면, 그때 저는 그 프로세스를 커스텀 기술 (custom skill)로 경화 (harden)합니다. 성공적인 플로를 가져와 반복 가능한 표준 운영 절차 (SOP, Standard Operating Procedure)로 최적화하는 것입니다.
내부적으로 이것이 어떻게 작동하는지 개념을 잡으실 수 있도록, 하네스는 브라우저 에이전트 (browser agent)가 읽을 수 있는 기술의 구조화된 JSON 정의를 출력합니다:
{
"skill_name": "Government_Contract_Outreach",
"trigger": "New RFP Detected",
...
앞으로 제가 이 새로운 기술 (skill)을 실행할 때마다, AI는 어떤 어조 (tone of voice)를 사용해야 하는지, 어디에서 데이터를 찾아야 하는지, 그리고 이메일을 어떻게 구성해야 하는지를 정확히 알고 있습니다. 저는 전문가의 조언을 바탕으로 고차원적인 비즈니스 기술 라이브러리를 구축하고 있으며, 이제 제 AI 에이전트들은 명령에 따라 이를 실행할 수 있습니다.
데이터: 기술 고도화 (Hardening Skills)가 확장에 필수적인 이유
왜 굳이 프로토타이핑과 기술 고도화 (hardening) 과정을 거쳐야 할까요? 작업을 수행해야 할 때마다 그냥 멘토의 가공되지 않은 녹취록 (raw transcript)을 AI에게 전달하면 안 되는 걸까요?

매번 방대한 녹취록을 로드하는 것은 토큰 (tokens)과 비용을 낭비할 뿐이기 때문입니다.
네, 기술을 처음 구축할 때는 여전히 12,000 토큰에 달하는 방대한 녹취록을 하네스 (harness)에 로드해야 합니다. AI가 전문가의 조언을 분석하고, 워크플로 (workflow)를 테스트하며, 최선의 접근 방식을 찾아내도록 하기 위해 토큰 비용을 지불해야 합니다.
하지만 진짜 비용 절감은 훈련이 끝난 이후에 일어납니다.
우리가 프로세스를 하나의 기술로 고도화 (harden)하는 이유는, 이것이 비즈니스에서 반복적으로 실행하게 될 고부가가치 작업이기 때문입니다. 만약 작업을 수행하기 위해 매일 AI에게 가공되지 않은 녹취록을 전달한다면, 당신은 AI가 매번 컨텍스트 (context)를
| 워크플로우 유형 (Workflow Type) | 컨텍스트 토큰 (Context Tokens, 실행당) | 작업 데이터 (Task Data, RFP) | 총 토큰 (Total Tokens, 실행당) | 총 토큰 (Total Tokens, 50회 실행) |
|---|---|---|---|---|
| 가공되지 않은 녹취록 전략 (Raw Transcript Strategy) | 12,000 | 1,000 | 13,000 | 650,000 토큰 (Tokens) |
| 고도화된 AI 기술 (Hardened AI Skill, SOP) | 700 | 1,000 | 1,700 | 85,000 토큰 (Tokens) |
프로세스를 하나의 기술 (skill)로 고도화함으로써, 우리는 토큰 소비량을 87% 절감할 수 있습니다.
이는 OpenAI, Google, Claude 전반에 걸쳐 API 비용을 획기적으로 줄여줄 뿐만 아니라, 지연 시간 (latency) 또한 크게 단축시킵니다. 1,700개의 토큰을 처리하는 에이전트는 몇 초 만에 작업을 수행하는 반면, 13,000개의 컨텍스트 윈도우 (context window)는 AI가 환각 (hallucinate)을 일으키거나 브라우저 단계를 실행하는 데 몇 분이 걸리게 만들 수 있습니다.
3단계: 브라우저 제어하기 (에이전트 비교)
이 단계가 바로 실행이 일어나는 지점입니다. 하네스 (harness)를 통해 구축된 기술들은 대개 SaaS 플랫폼에 로그인하고, 메뉴를 클릭하며, 설정을 구성하는 과정을 필요로 합니다.
이 작업을 직접 수행하는 대신, 저는 Chrome에 로그인한 뒤 세션 (session)을 AI 에이전트에게 넘겨주고 해당 기술을 실행하도록 안내합니다. 하지만 웹 자동화 (web automation) 측면에서 모든 에이전트가 동일한 성능을 내는 것은 아닙니다. 광범위한 테스트를 거친 결과, 현재 주요 플레이어들이 실제로 브라우저를 얼마나 잘 제어하는지에 대한 저의 최종 순위는 다음과 같습니다:
- ChatGPT (Atlas를 활용한 경우): 논쟁의 여지 없는 1위. OpenAI는 Codex와 Atlas를 단일하고 통합된 제품으로 병합했습니다. Atlas가 내장되어 있기 때문에, 현재 브라우저를 구동하는 데 있어 절대적으로 가장 뛰어난 에이전트입니다. 결정적인 기능은 무엇일까요? Chrome에서 로그인 정보를 직접 가져와 웹 자동화의 가장 큰 마찰 지점(인증 및 세션 관리)을 제거할 수 있게 해준다는 점입니다.
- Claude: 강력한 2위. Anthropic의 역량은 정말 인상적이며, 복잡한 UI를 탐색하는 데 매우 뛰어납니다. 하지만 눈에 띄는 결함이 있습니다. 만약 여러 컴퓨터에 걸쳐 Claude 확장을 설치했다면, 어떤 기기를 실제로 구동하려는 것인지 가끔 혼란을 겪습니다. 강력하지만, 이 컨텍스트 전환 버그 때문에 최고 자리를 차지하기 어렵습니다.
- Antigravity: Antigravity는 기술적인 작업을 위한 환상적인 에이전트 IDE이지만, 순수한 웹 구동 장치로서 비즈니스 실행 관점에서는 현재 3위에 머뭅니다. 결코 나쁜 도구는 아니지만, 현재로서는 ChatGPT나 Claude만큼 소비자용 SaaS 인터페이스를 탐색하는 데 유연하거나 특화되어 있지 않습니다.
실제 스킬 작동 예시입니다:
- 조언: 통화 중, 저의 멘토가 정부 계약 후속 조치에 대한 새로운 전략을 설명해 줍니다.
- 장치(Harness): AI는 이 전략을 추출하여 RFP 분석 및 제 목소리로 이메일 초안 작성을 위한 반복 가능한 SOP(
우리는 덕트 테이프로 붙여놓은 듯한 스프레드시트와 수동 데이터 입력의 시대를 지나고 있습니다. 만약 귀하의 팀이 표준 비즈니스 로직을 실행하기 위해 여전히 브라우저 탭을 수동으로 클릭하고 있다면, 귀하는 가장 가치 있는 자원을 낭비하고 있는 것입니다.
요약 (TL;DR - 빠르게 훑어보는 분들을 위해):
- 문제점: 비즈니스 전략과 실행 사이의 간극이 매우 큽니다.
- 해결책: 멀티 LLM 장치(multi-LLM harness; OpenAI, Google, Claude)를 사용하여 전문가의 조언을 추출하고 AI SOP(표준 운영 절차)를 프로토타이핑하세요.
- 실행: 해당 SOP를 하나의 "기술(Skill)"로 고도화하여 토큰 비용을 87% 절감하고, AI 에이전트(Atlas가 결합된 ChatGPT 등)가 브라우저를 물리적으로 제어하여 이를 실행하게 하세요.
Why57에서 우리는 데이터 입력 사무원을 군대처럼 고용하지 않고도 규모를 확장하고자 하는 기업들을 위해 맞춤형 소프트웨어와 자동화된 워크플로우(workflows)를 구축합니다. 우리는 고수준의 전략을 자동화된 결점 없는 실행으로 전환하는 바로 그러한 시스템을 구축합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기