Vercel Sandbox에서 Terminal-Bench 및 기타 Harbor 평가 실행 기능 추가
요약
Vercel Sandbox에서 Harbor 평가 기능을 추가하여 SWE-bench, tau3-bench 등 다양한 벤치마크를 실행할 수 있게 되었습니다. 이 기능은 격리된 Firecracker 마이크로VM을 사용해 병렬 처리가 가능하며, AI Gateway와 결합하여 여러 모델의 성능을 쉽게 비교하고 테스트할 수 있습니다.
핵심 포인트
- Vercel Sandbox에서 Harbor 평가(evals) 실행 지원
- SWE-bench 등 다양한 벤치마크를 격리된 VM에서 실행
- AI Gateway와 연동하여 다중 모델 벤치마킹 용이
이제 Vercel Sandbox에서 Harbor 평가(evals)를 실행할 수 있습니다.
이 오픈 소스 하네스는 SWE-bench, tau3-bench, OSWorld 등 다른 많은 벤치마크를 포함하는 레지스트리를 갖추고 있습니다. 각 시도는 자체 격리된 Firecracker 마이크로VM에서 실행되므로, 로컬 머신이 처리할 수 있는 수준을 훨씬 뛰어넘어 병렬화할 수 있습니다. HarborTerminal-Bench--env vercel``harbor run
작업의 네트워크 정책은 VM 외부, 즉 샌드박스 방화벽에서 적용됩니다. 선택적 자격 증명 주입(credential injection)은 해당 방화벽에서 일치하는 아웃바운드 요청에 비밀 정보를 첨부하므로, 비밀 정보가 샌드박스로 들어오는 것을 막습니다.
AI GatewayAI_GATEWAY_API_KEY``--model와 결합하면 여러 제공업체의 수백 가지 모델에 접근할 수 있으며, 다른 모델을 벤치마킹하는 것은 다른 :--model을 사용한 동일한 명령입니다.
OpenAI 모델을 대상으로 동일한 벤치마크를 실행하려면 SwapAI_GATEWAY_API_KEY``--model로 전환하십시오. --model``vercel_ai_gateway/openai/gpt-5.6-luna
Harbor 이상이 필요합니다. 설정, 구성 및 문제 해결을 위해 여기의 단계별 가이드를 따르십시오. Sandbox 문서에서 더 많은 정보를 얻을 수 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Vercel AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기