
Supabase의 Evals 벤치마크가 Claude Code에 실전 성적표를 부여하다
요약
Supabase가 Claude Code, Codex 등 코딩 에이전트의 성능을 실제 개발 워크플로 기반으로 측정하는 오픈 소스 벤치마크 'Evals'를 출시했습니다. 사용자는 자신의 저장소에서 직접 실행하여 에이전트의 강점과 약점을 객관적으로 파악할 수 있습니다.
핵심 포인트
- 실제 SQL 작성 및 디버깅 등 실무 워크플로 기반 벤치마크 제공
- Claude Code가 현재 여러 카테고리에서 높은 성능 기록
- 오픈 소스로 제공되어 사용자 정의 작업 추가 및 CI 통합 가능
- 에이전트의 성능을 반복 가능하고 객관적인 수치로 측정 가능
Supabase Evals는 실제 Supabase 작업에서 Claude Code, Codex, OpenCode의 점수를 매기는 오픈 소스 벤치마크 (benchmark)입니다. 여러분의 저장소(repo)에서 supabase eval을 실행하여 에이전트의 약점을 찾아보세요.
핵심 요약 (Key Takeaways)
- Supabase Evals는 실제 Supabase 작업에서 Claude Code, Codex, OpenCode의 점수를 매기는 오픈 소스 벤치마크 (benchmark)입니다.
- 여러분의 저장소(repo)에서
supabase eval을 실행하여 에이전트의 약점을 찾아보세요.
변경 사항 — Supabase Evals가 이제 오픈 소스가 되었습니다

Supabase는 Claude Code, OpenAI의 Codex, OpenCode와 같은 코딩 에이전트 (coding agents)를 실제 Supabase 작업을 통해 테스트하는 오픈 소스 벤치마크 (benchmark)인 Evals를 출시했습니다. 이것은 장난감 같은 문제들로 구성된 또 다른 합성 벤치마크 (synthetic benchmark)가 아닙니다. SQL 쿼리 작성, TypeScript 타입 오류 수정, 함수 리팩토링 (refactoring), 엣지 케이스 (edge cases) 디버깅 등 여러분이 매일 수행하는 작업과 같은 Supabase의 실제 개발 워크플로 (workflow)에서 추출한 작업 세트입니다.
이 벤치마크 (benchmark)는 **확장 가능 (extensible)**하도록 설계되었습니다. 즉, 여러분의 특정 코드베이스 (codebase)에서 에이전트를 테스트하기 위해 자신만의 작업을 추가할 수 있습니다. 지금까지의 결과는 어떨까요? Claude Code가 많은 카테고리에서 가장 높은 점수를 받았지만, 진정한 가치는 리더보드 (leaderboard)가 아니라 여러분의 프로젝트에 직접 이를 실행할 수 있는 능력에 있습니다.
여러분에게 의미하는 바 — 자신만의 에이전트 워크플로 (Agent Workflows) 벤치마킹하기
만약 여러분이 Claude Code를 매일 사용하고 있다면, 이 벤치마크 (benchmark)는 그것이 여러분의 코드베이스 (codebase)를 얼마나 잘 처리하는지 반복 가능하고 객관적인 방법으로 측정할 수 있는 수단을 제공합니다. 느낌이나 일화적인 증거에 의존하는 대신, Evals를 실행하여 Claude Code가 어디에서 뛰어나고 어디에서 어려움을 겪는지 정확히 확인할 수 있습니다.
여기 핵심이 있습니다. 이 벤치마크 (benchmark)는 **오픈 소스 (open source)**이므로, 이를 포크 (fork)하여 프로젝트 스택에 특화된 작업을 추가하고 CI 파이프라인 (CI pipeline)에 통합할 수 있습니다. 모든 PR (Pull Request)이 벤치마크 (benchmark) 실행을 트리거하여 에이전트의 변경 사항이 성능 저하를 일으키지 않도록 보장하는 상황을 상상해 보세요.
지금 바로 시도해 보세요 — Evals 설정 및 실행
시작하는 방법은 간단합니다. 저장소 (repository)를 클론 (clone)하고 로컬 환경에서 벤치마크 (benchmark)를 실행하세요:
git clone https://github.com/supabase/evals
cd evals
# 의존성 (dependencies) 설치
...
사용자 정의 작업 세트 (custom task set)를 지정할 수도 있습니다:
supabase eval --agent claude-code --tasks ./my-tasks/
자신만의 작업을 추가하려면, tasks/ 디렉토리에 명확한 설명과 예상 결과가 포함된 마크다운 (markdown) 파일을 생성하세요. 예를 들어:
# 작업: 깨진 마이그레이션 (Migration) 수정
**설명:** 마이그레이션 파일 `20260101_add_users.sql`에 구문 오류 (syntax error)가 있습니다. `supabase db push`가 성공하도록 수정하세요.
...
그러면 벤치마크가 이 작업에 대해 Claude Code를 실행하고 결과를 점수화합니다.
이것이 귀하의 Claude Code 워크플로 (workflow)에 중요한 이유

벤치마킹 (benchmarking)은 단순히 재미를 위한 것이 아니라, **진단 도구 (diagnostic tool)**입니다. 귀하의 코드베이스 (codebase)에서 Evals를 실행하면 다음 사항을 발견할 수 있습니다:
- 프롬프트 (prompt) 약점: 만약 Claude Code가 복잡한 SQL 조인 (joins)이 포함된 작업에서 실패한다면,
CLAUDE.md에 더 많은 컨텍스트 (context)를 추가하거나 프롬프트 엔지니어링 (prompt engineering)을 개선해야 함을 알 수 있습니다. - 도구 오용 (tool misuse): 직접적인 SQL 쿼리 (query)가 더 빠를 수 있는 상황에서 Claude Code가
supabaseCLI 명령어를 과도하게 사용할 수도 있습니다. 벤치마크는 이러한 패턴을 드러냅니다. - 회귀 (regression) 탐지: Claude Code 또는 모델을 업데이트한 후, 성능이 저하되지 않았는지 확인하기 위해 벤치마크를 다시 실행하세요.
더 큰 그림 — 벤치마크가 표준이 되어가고 있습니다
Supabase Evals는 SWE-bench 및 Terminal-Bench와 같이 점차 성장하고 있는 벤치마크 생태계에 합류합니다. Claude Code는 이미 이러한 벤치마크에서 인상적인 점수(Opus 모델로 SWE-bench Verified에서 88.6% 기록)를 얻었지만, 정작 중요한 것은 **여러분의 코드베이스 (codebase)**입니다. 일반적인 벤치마크는 Claude Code가 여러분의 특정 Postgres 스키마 (schema)나 인증 (auth) 로직을 제대로 처리하는지 알려줄 수 없습니다. Evals를 사용하면 이를 수행할 수 있는 맞춤형 테스트 스위트 (test suite)를 구축할 수 있습니다.
결론 (Bottom Line)
Supabase Evals는 단순한 리더보드 그 이상입니다. 이는 **지속적인 개선을 위한 도구 (tool for continuous improvement)**입니다. 이를 클론 (clone)하고 실행하여 여러분의 에이전트 (agent) 성능을 측정하기 시작하세요. 그 결과는 여러분을 놀라게 할 것이며, Claude Code 워크플로 (workflows)를 측정 가능한 수준으로 더 개선해 줄 것입니다.
출처: news.google.com
원문은 gentic.news에 게시되었습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기