LiveEvalBench: 웹 생성(Web Generation)의 오픈 월드 평가를 향하여
요약
기존의 정적인 웹 생성 평가 방식의 한계를 극복하기 위해 에이전트 기반의 자동화된 평가 프레임워크인 LiveEvalBench를 제안합니다. 이 프레임워크는 빌드, 코드, UI 테스터 역할을 수행하는 에이전트들이 협업하여 웹 프로젝트의 전체 라이프사이클을 상호작용적으로 평가합니다.
핵심 포인트
- 정적 벤치마크를 넘어선 에이전트 기반의 적응형 평가 프로세스 제안
- 빌드, 코드, UI 테스터 에이전트 간의 협업 리뷰 워크플로 구현
- 구현의 다양성을 수용하기 위한 공유 루브릭과 맞춤형 기준 결합
- 새로운 평가 역할과 차원을 쉽게 통합할 수 있는 확장성 제공
- 인간 전문가의 판단과 높은 일치도를 보이며 모델 성능의 세밀한 분석 가능
대규모 언어 모델(Large language models)은 실행 가능한 프론트엔드 프로젝트를 합성하는 능력이 점점 더 향상되고 있지만, 기존의 벤치마크(benchmarks)는 여전히 웹 생성(web generation)을 정적인 평가 문제로 취급하고 있습니다. 우리는 프론트엔드 결과물(artifacts)이 다른 패러다임을 요구한다고 주장합니다. 즉, 프론트엔드 결과물은 정적이기보다 상호작용적(interactive)이며, 다양하면서도 동일하게 유효한 구현(implementations)을 허용하고, 경직된 파이프라인(pipelines)이 수용할 수 있는 것보다 더 빠르게 진화합니다. 이러한 격차를 해소하기 위해, 우리는 웹 생성 평가를 에이전트 기반의(agentic), 적응형(adaptive)이며 확장 가능한(extensible) 프로세스로 재정의하는 자동화된 프레임워크인 LiveEvalBench를 제시합니다. LiveEvalBench는 평가를 협업 리뷰 워크플로(collaborative review workflow)로 구현하며, 여기에는 빌드 엔지니어(Build Engineer), 코드 엔지니어(Code Engineer), 그리고 UI 테스터(UI Tester)가 배포 및 코드 검사부터 브라우저 기반 상호작용에 이르기까지 프론트엔드 프로젝트의 전체 라이프사이클(lifecycle)에 걸쳐 증거를 공동으로 수집합니다. 구현의 다양성을 처리하기 위해, 적응형 프로토콜(adaptive protocol)은 모델 간 비교 가능성을 위한 공유 루브릭(shared rubrics)과 각 결과물에 맞춤화된 구현 기반 기준(implementation-grounded criteria)을 결합합니다. 또한 이 프레임워크는 파이프라인의 재설계 없이 새로운 평가자 역할(evaluator roles)과 평가 차원(assessment dimensions)의 점진적인 통합을 지원합니다. 다양한 실제 웹 생성 시나리오에 걸친 실험을 통해, LiveEvalBench가 인간 전문가의 판단과 밀접하게 일치하며 최첨단 모델(frontier models)의 웹 생성 능력에 대한 세밀한 통찰력을 제공함을 보여줍니다. 코드는 https://github.com/wyysteelhead/LiveEvalBench 에서 확인할 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv Codex (cs.SE)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기