Agent Harness가 브라우저 조작을 선택 문제로 변환: Browser Use jev-ultrafast v0.1.0
요약
새로운 jev-ultrafast v0.1.0 버전은 AI 에이전트의 브라우저 조작 방식을 혁신합니다. 스크린샷 기반의 불안정한 루프 대신, 페이지의 보이는 컨트롤을 번호가 매겨진 리스트로 변환하여 판단 모델(Jev)에게 일괄 선택하게 합니다. 이를 통해 안정성과 속도를 크게 개선했습니다.
핵심 포인트
- 스크린샷 의존성을 제거하고 구조화된 요소 목록으로 전환
- 판단 모델이 조작할 대상과 종류를 명확히 선택하도록 함
- Google Flights 검색 작업 시간을 9.450초에서 7.092초로 단축 (약 25% 개선)
- 모델 출력은 셀렉터/좌표가 아닌 구조화된 명령 형태로 제공
AI에게 항공편 검색을 맡기면, 매 단계마다 스크린샷을 찍고 다시 읽어보고, 버튼 하나를 잘못 누르면 처음부터 다시 해야 합니다. jev-ultrafast v0.1.0 (Browser Use, 2026년 9월 공개)은 이러한 기본 루프를 변경합니다. 스크린샷을 사용하지 않고, 페이지의 보이는 컨트롤을 번호가 매겨진 리스트로 만들어 판단 모델이 조작과 대상을 일괄 선택하게 하는 방식입니다. 본고의 수치는 공식 리포지토리와 TypeSafe 문서를 통해 확인했습니다 (2026-10-02 시점, 필자 실측 아님).
먼저 로컬 환경 없이 핵심을 확인할 수 있습니다. 로그인 정보가 없는 페이지의 스크린샷을 준비하고, 동일한 질문을 두 개의 세션에 던집니다.
- 스크린샷만 전달하며, '다음으로 조작해야 할 컨트롤은 무엇인가'라고 묻습니다. 답변이 가리키는 요소가 실제로 존재하는지 확인합니다.
- 같은 페이지를 다음 형식으로 전달합니다:
[1] button Trip type · Round trip
[2] combobox From · empty
[3] textbox Departure date · empty
...
번호 리스트 버전은 사람이 검증하기 쉽고, 모델이 존재하지 않는 선택지를 생성하기 어렵게 만듭니다. 핵심은 다음과 같습니다: 브라우저 에이전트는 페이지 상태를 검사 가능한 선택지로 나열하고, 그 위에서 모델에게 조작과 대상을 선택하게 합니다.
-
페이지 관찰마다 표시되는 주요 HTML/ARIA 컨트롤을 번호가 매겨진 요소표로 만듭니다. 조작은 CLICK / TYPE_TEXT / SELECT / SCROLL_UP / SCROLL_DOWN / WAIT / DONE / BLOCKED의 8가지 종류이며, 각 조작 후보에는 호환 요소만 포함됩니다.
-
요소표를 TypeSafe의 Jev (System One 판단 모델)에 보내 한 번의 왕복으로 조작과 대상을 얻습니다. 후보의 확률과 confidence도 반환됩니다.
-
텍스트 생성은 TYPE_TEXT일 때만 이루어집니다. 기본 데모는 OpenRouter를 통한 inception/mercury-2.5 (추론 오프)로, 녹화 시 'Zurich' 생성에 581ms가 소요되었습니다.
-
실행 계층이 페이지의 신선도・대상・차폐 상태를 실행 전에 재검증합니다. 모델 출력은 셀렉터・좌표・커맨드・JavaScript 형태가 아니며, 화면 밖의 텍스트는 컨텍스트로 전송되지 않습니다.
-
Google Flights 녹화 작업 시간은 7.073초입니다. 측정은 첫 페이지 관찰 이후부터이며, 모델 호출・텍스트 생성・브라우저 조작・무효화된 판단・로드 대기 시간을 포함하고, 브라우저 실행・초기 네비게이션・실행 후 독립 검증은 포함하지 않습니다. Jev 요청 횟수는 17회, 중앙값 레이턴시는 178ms입니다.
-
동일 작업의 6회 교차 실행 비교: 중앙값 9.450초 → 7.092초 (25% 단축), TypeSafe 요청은 22 → 17, 브라우저 프로토콜 호출은 1,092 → 101입니다. 공식 주의사항: 3 쌍으로는 강력한 통계적 주장이 불가능합니다 (sign-test p = 0.25) 그리고 일반적인 벤치마크가 아닙니다.
-
Wikipedia 기사 열기 2.798초, 로컬 호텔 검색 1.896초는 독립 스모크 테스트로, 속도 비교에는 포함되지 않습니다.
-
비용: Jev 1.13은 입력 100만 토큰당 0.042달러, 출력 무료입니다 (공식 모델 페이지). 녹화의 90,558 입력 토큰은 근사치로 0.0038달러, 텍스트 2회 실청구는 0.00006272달러와 합계 약 0.0039달러입니다. 공개 단가에 의한 근사치이며, 브라우저 비용은 포함하지 않습니다.
-
설치 및 두 개의 API 키 (TypeSafe / OpenRouter) 설정은 서두를 필요가 없습니다. 먼저 채팅 2개를 검증하세요.
-
frames・Canvas・업로드・새 탭・임의의 키보드 위젯은 본 버전에서 미지원입니다.
-
DONE은 성공의 증거가 아닙니다. 공식 샘플도 실행 후에 결과를 독립적으로 검증합니다. Chrome의 기존 프로파일과 로그인 상태를 공유하기 때문에, 로그인・주문・결제는 사람이 수행해야 합니다.
-
7초를 일반적인 성능 보장으로 읽지 마십시오. 이는 1 시나리오 1 녹화 결과입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기