버그 리포트에서 브라우저 실행 가능 절차로: 웹 GUI 버그 재현을 위한 LLM 기반 에이전트
요약
자연어 버그 리포트를 기반으로 웹 GUI 버그를 자동으로 재현하는 LLM 에이전트 시스템 ReBug을 제안합니다. ReBug은 누락된 전제 조건을 재구성하고 브라우저 내에서 직접 실행 및 검증하는 2단계 프로세스를 통해 높은 재현 성공률을 달성했습니다.
핵심 포인트
- 자연어 리포트에서 누락된 종속성 및 전제 조건 자동 재구성
- 브라우저 기반의 엔드-투-엔드 시각적 실행 및 검증 기능 제공
- 실제 웹 애플리케이션 667개 테스트 결과 높은 작업 완료율 달성
- 문맥 인식 및 상태 인식 브라우저 실행을 통한 효과적인 버그 재현
자연어 버그 리포트로부터 웹 GUI 버그를 재현하는 것은 소프트웨어 유지보수에 매우 중요하지만, 리포트에 종속성(dependencies)이나 입력 파일과 같은 전제 조건이 누락되는 경우가 많아 여전히 어려운 과제로 남아 있습니다. 기존의 버그 재현 기술은 주로 코드 단위나 모바일 애플리케이션을 대상으로 하며, 웹 GUI를 위한 엔드-투-엔드(end-to-end) 시각적 실행 및 검증 기능이 부족합니다. 본 논문에서는 실제 브라우저를 구동하여 웹 GUI 버그 리포트로부터 브라우저 수준의 재현 절차를 재구성, 실행 및 검증하는 문맥 인식(context-aware) 에이전트 시스템인 ReBug을 제안합니다. ReBug은 재현 과정을 두 단계로 분리합니다. 준비(preparation) 단계에서 ReBug은 리포트와 사용 가능한 아티팩트(artifacts)로부터 누락된 전제 조건을 재구성하고, 상위 수준의 재현 계획을 생성합니다. 실행(execution) 단계에서는 브라우저 내에서 도구 매개 상호작용(tool-mediated interactions)을 수행하고, 페이지 상태와 작업 이력의 구조화된 요약을 유지하며, 리포트에서 도출된 기대치와 최종 상태를 비교하여 검증합니다. 우리는 4개의 오픈 소스 웹 애플리케이션에서 추출한 667개의 실제 버그 리포트를 통해 ReBug을 평가했습니다. 통제된 현재 배포 환경에서 ReBug은 두 가지 베이스라인(baselines) 모델보다 우수한 성능을 보였으며, 평균 RSR 49.96%, 평균 작업 완료율(task completion rate) 74.96%, 평균 작업 실행 성공률(action execution success rate) 86.54%를 달성했습니다. 우리의 결과는 명시적인 문맥 재구성(context reconstruction)과 상태 인식 브라우저 실행(state-aware browser execution)이 리포트 기반의 브라우저 재현을 효과적으로 지원함을 보여주며, 이력 재생(historical replay)을 통해 성공적인 절차가 복구된 버그 버전에서 원래의 버그가 존재하는 동작을 자주 노출한다는 것을 확인했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기