Playwright를 2배 빠르게, 토큰 효율을 80% 높게 만들었습니다
요약
Stagehand v4는 기존 Playwright의 단점을 개선하여, 브라우저 제어 및 작업 자동화에서 왕복 지연 시간을 획기적으로 줄였습니다. 새 아키텍처를 통해 Playwright 대비 속도를 2배 향상시키고 토큰 사용량은 80% 절감했습니다. 이는 복잡한 HTTP/WebSocket 요청 추적, 필터링 등 고급 기능을 효율적으로 처리할 수 있게 합니다.
핵심 포인트
- Playwright의 왕복 지연 시간 문제를 해결하여 성능을 대폭 개선함.
- 새 아키텍처로 Playwright 대비 2배 빠른 속도와 80% 낮은 토큰 사용량을 달성함.
- 브라우저 확장 프로그램 기반으로 동작 일괄 처리 및 효율적인 act(), extract()를 지원함.
2년 전 Stagehand를 만들었고, 현재 GitHub 스타 2만 4천 개와 월간 npm 다운로드 400만 건을 기록 중임. 최근 가장 큰 약점이었던 왕복 지연 시간을 해결함.
기존에는 동작마다 스크립트와 브라우저 사이를 왕복해야 했으며, 로컬에서는 짧지만 클라우드에서는 지연이 커짐. Playwright MCP의 과도한 토큰 소비에 대한 불만도 여러 차례 접함.
이를 해결하려고 처음부터 다시 만들어 v4를 출시함. 브라우저 시작 시 자동으로 로드되는 확장 프로그램에서 브라우저를 제어하며, 명령 일괄 처리와 토큰 효율적인 act(), extract()를 지원함. 새 아키텍처로 Playwright보다 2배 빠르고 토큰 사용량은 80% 적어짐.
최첨단 모델과 가중치 공개 모델 십여 종, Codex·Claude Code 등의 도구를 비교한 벤치마크는 https://www.stagehand.dev/evals에서 확인 가능함. 무엇이든 질문해 주시길 바람!
Playwright를 많이 쓰는데, 웹 테스트 중심의 설계와 작업 자동화 용도 사이에서 늘 마찰을 겪고 있음. 예를 들어 브라우저를 음소거 상태로 시작하는 기능조차 기본 지원하지 않아 답답함.
Stagehand는 복잡한 HTTP·WebSocket 요청 및 응답이나 콘솔 메시지 필터링을 어떻게 처리하나요? https://docs.stagehand.dev/v4/reference/page#on을 보면, 익명 함수나 람다로 지정한 필터에 맞는 모든 통신을 추적하고 싶음. URL 패턴만 볼 때도 있지만, 정보가 부족하면 페이로드까지 검사해야 함.
Playwright는 왕복 지연뿐 아니라 몇 바이트만 읽어 판단할 필터 함수에 응답 전체를 전달하느라 너무 느림. 전체 요청 중 관심 있는 것은 약 1%인 경우가 많아 낭비가 매우 커짐.
이상적으로는 필터도 브라우저 안에서 실행하고 싶음. 지금은 대개 충분한 첫 100바이트에서 부분 문자열을 찾지만, 더 유연한 필터나 확장 프로그램에서 eval로 실행하는 필터 함수도 있으면 좋겠음. 문서상으로는 지원하지 않는 듯한데, 이런 방향의 계획이 있나요?
고객 사이트를 진단하는 데 Playwright를 쓰고 있어 두 가지가 궁금함. Chrome DevTools 전체 기능을 지원하나요? 예를 들어 fetch()의 호출 출처나 쿠키를 설정한 스크립트를 추적할 수 있나요? AWS Lambda에 설치하기는 얼마나 어려운가요? Playwright는 컨테이너 없이 실행할 수 있어 시작 시간과 비용을 크게 줄일 수 있음. 하루에도 수십억 번 쓰이는 기반 도구들이 발전하는 모습은 늘 흥미로움.
캐싱 방식이 유용해 보이며, 특히 자동 복구형 CI 테스트에 흥미롭게 활용할 수 있을 듯함.
캐시된 act()가 실패해 LLM으로 다시 평가해야 한다는 것을 어떻게 판단하나요? 캐시가 Browserbase 같은 클라우드에 저장된다면, 서로 다른 사이트 버전이 같은 캐시를 사용하는 CI 파이프라인에서 캐시가 빈번하게 교체되지 않을까요?
캐시를 반드시 Browserbase에서 제공해야 하고, 스크립트와 함께 버전 관리하는 로컬 파일로 둘 수 없는 기술적 이유가 있나요? 로컬 파일이라면 개발자는 LLM 호출로 실패한 테스트를 로컬에서 복구하고, CI는 완전히 결정론적으로 실행할 수 있음.
고객 컴퓨터에서 브라우저 자동화를 수행하는 데 쓸 수 있나요? 눈에 띄는 문제는 LLM용 API 토큰이 노출된다는 것뿐임.
제어는 어디서 이루어지나요? 고객 컴퓨터에 설치된 소프트웨어인가요, AI 에이전트에 연결되는 설치형 소프트웨어인가요, 아니면 더 외부에 있거나 상호작용이 많은 다른 방식인가요?
기업에서 테스트 1,000개짜리 Playwright 테스트 모음을 사용한다면, 기본적으로 CI도 약 2배 빨라진다는 뜻인가요? 그렇다면 효과가 엄청날 듯함.
맞음. 이제 Stagehand가 브라우저 내부에서 실행되므로 왕복 통신 시간을 줄일 수 있음. 동작 일괄 처리까지 활성화하면 테스트 실행을 더 가속할 수 있음.
문서를 보면 약속한 속도 향상은 주력 제품을 써야만 얻을 수 있는 것으로 보임.
일반적인 에이전트 기반 검증 작업에서 agent-browser 대신 Stagehand를 추천하나요? 성능상 이점이 있나요?
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기