제공된 결정 모델을 활용한 에이전트용 로컬 실행 평가 도구 jevals
요약
본 글은 에이전트 평가의 비용 및 지연 시간 문제를 해결하기 위한 로컬 실행 평가 도구 'jevals'를 소개합니다. 기존 LLM-as-a-judge 방식은 비싸고 느리지만, jevals는 결정 모델(원샷 분류기)을 활용하여 효율적인 로컬 테스트 환경을 제공합니다.
핵심 포인트
- 에이전트 평가는 비용과 지연 시간이 큰 문제다.
- jevals는 로컬에서 평가를 실행하는 도구이다.
- 결정 모델은 자연어 질문으로 적응 가능하며 범용성이 높다.
- 분류 및 회귀 같은 전통적인 방식의 유효성을 강조한다.
현재 JEV에 대한 관심이 매우 높고, KEV나 Laya 같은 로컬/오픈 버전도 많이 있습니다.
하지만 저는 결정 모델(또는 솔직히 말해서 원샷 분류기)을 통해 실제로 이점을 얻을 수 있는 사용 사례가 하나 있다고 생각합니다. 바로 에이전트 평가입니다. 현재 LLM-as-a-judge 평가는 비용과 지연 시간 면에서 매우 비쌉니다.
제가 기대하는 점은 다음과 같습니다:
로컬에서 평가 실행하기. 시스템을 평가하기 위해 요청을 보내는 것은 비용이나 지연 시간 측면에서 의미가 없습니다. 수백만 또는 수십억 개의 결정이 있을 때, 모든 판단에 대해 텍스트를 생성하는 것은 비싸집니다. 저는 OpenAI의 병렬 처리 레시피를 사용하여 Ragas 속도를 높이려고 시도했지만 여전히 병목 현상을 겪었던 기억이 납니다. 이러한 오버헤드는 에이전트 루프 내부에서는 더욱 중요합니다.
일반화. 새로운 파인튜닝 프로젝트를 매번 시작하지 않고 자연어 질문을 통해 적응시킬 수 있는 분류기는 훨씬 더 많은 사용 사례를 실용적으로 만들 수 있습니다. 테스트는 자체 데이터에서 얼마나 잘 작동하는지입니다.
작업에 맞는 올바른 모델 선택. 분류와 회귀는 유용성을 잃은 적이 없습니다. 우리는 텍스트 생성에 너무 흥분한 나머지, 답이 레이블, 확률 또는 점수인 문제에도 이를 적용하기 시작했습니다.
여러분의 피드백을 받고 싶습니다. github 링크는 여기입니다: https://github.com/openlayer-ai/jevals
제출자 /u/byebaybay
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기