OpenEval: LLM 평가에 표준 형식이 필요한 이유
요약
LLM 평가 프레임워크 간의 데이터 호환성 문제를 해결하기 위한 OpenEval 프로젝트를 소개합니다. 표준화된 JSON Schema를 통해 테스트 케이스와 채점자 데이터를 프레임워크 간에 쉽게 이동할 수 있도록 지원합니다.
핵심 포인트
- LLM 평가 프레임워크 간 데이터 이식성 문제 해결
- 테스트 케이스, 채점자, 결과에 대한 표준 JSON Schema 정의
- TypeScript 및 Python SDK와 CLI 도구 제공
- 기존 프레임워크 데이터셋을 위한 컨버터 지원
오늘날 모든 LLM (Large Language Model) 평가 프레임워크는 자신만의 테스트 케이스 형식, 자체적인 채점자 (grader) 정의, 그리고 자체적인 결과 스키마 (schema)를 만들어내고 있습니다. DeepEval, Promptfoo, Inspect AI, 그리고 lm-evaluation-harness는 모두 동일한 핵심 문제(모델의 출력이 올바른지 확인하는 것)를 해결하고 있지만, 그 중 어느 것도 서로의 평가 데이터셋을 읽을 수 없습니다.
이는 팀이 프레임워크를 비교하고 싶을 때마다, 또는 노트북 프로토타입에서 프로덕션 평가 파이프라인으로 전환할 때마다, 결국 동일한 테스트 케이스를 반복해서 수동으로 다시 작성해야 함을 의미합니다.
OpenEval은 평가 테스트 케이스, 채점자 (grader), 그리고 결과에 대해 작고 이식 가능한 JSON Schema를 정의하고, 데이터를 다시 입력하는 대신 프레임워크 간에 데이터를 이동할 수 있는 도구를 제공함으로써 이 문제를 해결하려는 시도입니다.
레포지토리(repo) 구성 요소:
-
테스트 케이스, 채점자 설정 (grader configs), 그리고 결과 기록을 위한 버전 관리되는 JSON Schema 명세.
-
OpenEval 형식의 데이터셋을 읽고 쓰기 위한 TypeScript 및 Python SDK.
-
validate, convert, init, summarize 명령어를 포함한 CLI.
-
기존 데이터셋을 수동 재작성 없이 가져오거나 내보낼 수 있도록 인기 있는 프레임워크를 위한 컨버터 (Converters).
이 프로젝트는 방금 npm과 PyPI에 v1.0.0을 게시했으며, 아직 다뤄지지 않은 프레임워크를 위한 컨버터 연결을 돕고 싶은 분들을 위해 17개 이상의 프레임워크 통합에 대한 이슈 (issues)가 열려 있습니다.
Repo: https://github.com/adhabnr-ux/openeval
평가 도구 사이를 전환하면서 동일한 이식성 문제를 겪었던 분들의 피드백을 환영합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기