AI 에이전트는 모델이자 브라우저입니다. 문제는 그중 하나에 있습니다.
요약
AI 에이전트 트래픽 증가에 따라 병목 현상이 모델에서 브라우저 세션 계층으로 이동하고 있습니다. 벤치마크는 개선되었으나, 실제 웹 상호작용에서는 스크롤 루프나 만료된 세션 같은 실행 상태 문제가 주요 실패 원인입니다. 따라서 에이전트에게 더 나은 실행 상태와 절차적 가이드 제공이 중요하며, 오픈소스 에이전트 스택들은 일관된 브라우저 정체성 유지를 통해 이 문제를 해결하고 있습니다.
핵심 포인트
- AI 에이전트 트래픽 증가로 병목 현상이 모델에서 브라우저 계층으로 이동함.
- 실제 웹 상호작용 실패는 추론 오류보다 실행 상태(세션, 스크롤 등) 문제임.
- 에이전트의 성공률 향상은 더 똑똑한 모델보다는 '상태 추적' 능력 덕분임.
- 오픈소스 에이전트 스택은 일관된 브라우저 정체성 유지를 통해 신뢰성을 높이고 있음.
Cloudflare 네트워크에서 AI 에이전트의 일일 요청은 지난 한 해 동안 1,700% 이상 증가했으며, 처음으로 Cloudflare가 처리하는 트래픽 중 절반 이상이 인간이 아닌 것으로 나타났습니다 (출처: Cloudflare, 2026). 이 모든 요청에는 브라우저 세션이 필요하며, 모델을 2024년에 신뢰할 수 있게 만든 작업 중 거의 어느 것도 그 계층(layer)에 영향을 주지 못했습니다. 병목 현상은 모델 아래쪽으로 이동했습니다.
벤치마크는 개선되었지만, 브라우저는 그렇지 못했습니다
이번 주에 발표된 인간의 감사(audit)는 WebArena-Lite의 모든 165개 작업을 여섯 가지 조건 하에서 수행했으며, 자동 평가기가 실제 작업 성공률의 5.45%에서 8.49%를 놓쳤다는 것을 발견했습니다 (출처: arXiv, 2026). 같은 논문은 이후 102개의 실패한 궤적(trajectories)을 검토했고, 그 실패가 추론(reasoning) 실패가 아니라는 것을 알아냈습니다. 그것들은 스크롤 루프, 만료된 세션, 도달하지 못한 클릭, 그리고 절반만 채워진 양식들이었습니다 (출처: arXiv, 2026).
에이전트에게 더 나은 실행 상태(execution state)와 절차적 가이드(procedural guide)를 제공하자, 해당 작업들의 수정된 성공률은 34.55%에서 38.18%로 향상되었습니다 (출처: arXiv, 2026). 메모리 스캐폴딩(Memory scaffolding)만으로도 훈련되지 않은 9B 모델의 성공률을 13.90%에서 18.80%로 끌어올렸습니다 (출처: arXiv, 2026). 이러한 이득 중 어느 것도 더 똑똑한 모델에서 온 것이 아니었습니다. 그것들은 에이전트가 자신이 어디에 있는지 추적했기 때문에 발생했습니다.
웹사이트가 보는 것은 당신이 배포했다고 생각하는 것과 다릅니다
이러한 격차는 정체성(identity)이 코드의 속성이 아니기 때문에 존재합니다. 세션을 검사하는 페이지는 화면 크기, GPU 문자열, 글꼴 목록, 시간대, 언어, TLS 핸드셰이크 시그니처, 그리고 이벤트 스트림을 봅니다. 패치된 브라우저 엔진은 이러한 값들을 내부에서 결정하며, 이 경우 페이지는 보고된 값이 위조된 것인지 알 수 없습니다 (출처: GitHub, 2026).
이것이 바로 올가을 출시되는 오픈소스 에이전트 스택들이 래퍼(wrapper) 대신 브라우저를 탑재하는 이유입니다. 인기 있는 이 스택은 C++로 실제 Firefox 엔진을 패치하고, 시드당 하나의 일관된 정체성을 유지하여 화면, 글꼴, GPU, 시간대, 언어가 모두 일치하도록 하며, 페이지가 찾을 만한 것은 아무것도 남기지 않습니다: WebDriver 플래그도, DevTools 프로토콜도, 자동화 전역 변수도 없습니다 (출처: GitHub, 2026). 그럼에도 불구하고 이 스택은 한 줄의 스위치만으로 어떤 모델이든 수용할 수 있는데, 이는 모델 자체가 제약 사항이 아니었기 때문입니다 (출처: GitHub, 2026).
지문 일관성 함정(The Fingerprint Coherence Trap)
대부분의 팀들이 여기서 한 가지를 잘못 이해하며, 그로 인해 모든 것을 잃습니다. 그들은 JavaScript에서 값을 재정의하여 헤드리스 브라우저를 패치합니다. 그리하여 보고된 GPU가 보고된 글꼴과 모순되고 시간대가 네트워크 출구와 모순됩니다. 프로덕션 환경에서의 탐지(Detection)는 정확히 이러한 비일관성을 점수화하며, 세션이 세 가지 각도에서는 인간처럼 보이지만 네 번째 각도에서는 로봇처럼 보이는 경우 문제가 제기됩니다 (출처: Browserless, 2025).
해결책은 더 긴 목록의 재정의가 아닙니다. 지문(fingerprint)을 스스로 일치하거나 아예 나오지 않는 하나의 값으로 취급해야 합니다.
같은 문제, 한 단계 위에서: 정체성과 접근 권한(Identity and Access)
Cloudflare는 익명 봇 트래픽에 대한 해답을 통계적 방식이 아닌 암호학적 방식으로 제시했습니다. Web Bot Auth 프로토콜은 OpenAI, Google, AWS 등 운영자들이 에이전트 요청에 서명을 하도록 하며, 네트워크는 이제 매주 5천억 개 이상의 검증된 봇 요청을 확인합니다 (출처: Cloudflare, 2026). Google은 자체 크롤러 인증 가이드라인에서 동일한 프로토콜을 문서화했으며, AWS는 Bedrock AgentCore Browser에 미리 보기 지원을 출시했습니다 (출처: Google, 2025; AWS, 2025).
이것은 오픈 웹이 추측해 오던 질문, 즉 이 요청이 주장하는 에이전트가 맞는지 여부를 해결합니다. 하지만 기업이 던지는 질문은 다릅니다. 회사 내부에서는 더 어려운 질문이 '에이전트가 일단 입증된 후 무엇을 건드릴 수 있는지', 그리고 6개월 후에 감사(audit)를 할 때 누가 그 답을 할 수 있는가입니다.
현재 시장의 해답은 제어 평면(control plane)입니다. Island는 2024년 이후 두 배 이상 증가한 기업 가치 64억 달러를 인정받아 지난 9월에 4억 달러 규모의 Series F 투자를 유치했으며, 현재 기업용 에이전트 제어 평면으로 스스로를 판매하고 있습니다 (출처: Island, 2026). 이 회사는 직원 1,000명을 고용하고 있으며, 2022년 출시 이후 매 회계연도마다 연간 반복 매출(annual recurring revenue)을 두 배로 늘렸습니다 (출처: Island, 2026). CTO는 문제를 명확하게 설명합니다. 에이전트는 단일 계층에서 작동하지 않기 때문에 하나로부터 통제될 수 없습니다 (출처: Island, 2026).
주목할 세 가지 지표
Cloudflare 자체 데이터는 이미 경제적 변화가 일어나고 있음을 보여줍니다. AI 학습을 위해 선언된 크롤러 요청의 비중은 2025년 봄 22%에서 2026년 6월까지 52%로 증가했습니다 (출처: Cloudflare, 2026). 네트워크상의 사이트 중 검색 크롤러를 차단하는 곳은 1% 미만이지만, 학습 크롤러를 차단하는 곳은 17%에 달합니다 (출처: Cloudflare, 2026). 과거에는 부수적인 효과로 도착하던 사용자층이 이제는 목적에 따라 운영자가 선택하는 것이 되었습니다.
두 가지 지표가 더 어렵습니다. Cloudflare는 리테일(Retail), 컴퓨터 소프트웨어(Computer Software), IT 및 서비스(IT and Services), 금융 서비스(Financial Services) 전반에서 1년도 안 되어 최대 40%의 인간 트래픽 감소를 보고했습니다 (출처: Cloudflare, 2026). AI 크롤러 대역폭의 50% 이상이 마지막 시도 이후 변경되지 않은 페이지를 재요청하는 데 사용되고 있습니다 (출처: Cloudflare, 2026). 이 두 가지 모두 트래픽 문제라는 외피를 입은 비용 문제입니다.
월요일에 해야 할 일
하나의 에이전트를 처음부터 끝까지 감사(Audit)하고 다섯 가지 사항을 기록하십시오. 사이트가 인식하는 신원(identity), 그것이 일관적인지 여부, 세션 상태가 실행 간에 어디에 존재하는지, 에이전트가 내부적으로 도달할 수 있는 범위, 그리고 누군가가 누가 무엇을 했는지 물었을 때 감사 추적(audit trail)이 보여주는 내용입니다. 만약 어떤 답변이라도
Q: AI 에이전트에게 브라우저 탐지(browser detection)는 해결된 문제인가요?
A: 아닙니다. 탐지 계층은 계속 쌓이고 있으며, 대중의 반응은 더 긴 신호 목록을 패치하는 것보다는 브라우저 자체를 더 일관성 있게 만드는 것입니다 (출처: Browserless, 2025). 일관된 정체성을 가진 실제 엔진이 끊임없이 오버라이드 스택(override stack)을 쌓는 것보다 낫습니다 (출처: GitHub, 2026).
Q: Web Bot Auth가 엔터프라이즈 제어 평면(enterprise control plane)의 필요성을 대체할 수 있나요?
A: 이것은 공용 웹에서 에이전트가 누구인지를 증명합니다. 조직 내부에서는 그 에이전트가 무엇에 도달할 수 있는지, 그리고 나중에 누가 그 행동을 재구성할 수 있을지가 열린 질문입니다 (출처: Island, 2026).
Q: WebArena의 수치가 에이전트 배포 계획을 세우기에 충분히 신뢰할 만한가요?
A: 발표된 대로 그렇지 않습니다. 동일한 태스크 세트에 대한 인간 검토를 통해 놓친 성공 사례가 5.45점에서 8.49점까지 회복되었으며, 궤적(trajectory) 검토 결과 실패는 추론(reasoning) 메커니즘이 아닌 브라우저 메커니즘에 있었습니다 (출처: arXiv, 2026).
Q: 우리 팀이 자체 브라우저 스택을 구축해야 할까요?
A: 대부분은 그럴 필요가 없습니다. 유지 관리되는 엔진을 사용하고 공학적 시간을 여러분에게 특정한 것(세션 연속성, 접근 정책, 감사)에 투자하는 것이 좋습니다 (출처: Island, 2026).
핵심 시사점 (Key Takeaway)
모델들은 예정대로 발전했습니다. 하지만 그 밑단의 브라우저는 그렇지 못했고, 이것이 이제 에이전트가 도전 페이지에서 배포될지 아니면 중단될지를 결정하는 계층이 되었습니다. 2026년에 작동하는 에이전트를 배포하는 팀은 다른 어떤 것을 조정하기 전에 에이전트의 정체성을 일관되게 만들고, 세션을 지속 가능하게 하며, 접근을 감사 가능하도록 만든 팀입니다.
지금 당장 여러분의 스택에 있는 하나의 에이전트를 골라 낯선 사람에게 질문해보세요. 누가 행동했는지, 무엇을 건드렸는지, 그리고 6개월 후에 내가 그것을 증명할 수 있는지 말입니다?
출처 (Sources)
- Cloudflare: The Internet Has a Second Audience
- Island Announces $400 Million Series F, Bringing Valuation to $6.4 Billion
- arXiv: WebArena-Lite에서 웹 에이전트 평가 감사 (arXiv:2610.01491)
- Google Search Central: Web Bot Auth로 요청 인증하기
- AWS: AgentCore Browser의 Web Bot Auth를 사용하여 AI 에이전트용 CAPTCHA 감소시키기
- GitHub: feder-cr/dots - 오픈 소스 에이전트 브라우저
- Browserless: TLS Fingerprinting, 작동 방식 및 우회 방법
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기