AI 평가(evals)에 대한 이해 부족으로 AI 분야의 똑똑한 친구들에게 '바보' 취급을 당했습니다.
요약
본 글은 AI 에이전트의 성능 평가(evals) 개념을 '쉬운 모드', '어려운 모드', '신의 영역'으로 나누어 설명합니다. 에이전트가 작업을 올바르게 수행했는지 검증하는 방법과, 안전한 실습 환경 구축 및 자기 개선 루프를 통해 모델을 지속적으로 개선하는 방법을 제시합니다.
핵심 포인트
- evals는 작업(Tasks)과 이를 판단할 검증자(Verifiers)로 구성됩니다.
- 에이전트 테스트는 반드시 프로덕션 환경이 아닌 안전한 실습장에서 진행해야 합니다.
- 자기 개선 루프는 실제 동작을 evals/환경으로 변환하고 에이전트를 수정하는 반복 과정입니다.
- LangSmith나 Harbor 같은 도구를 활용하여 트레이싱 및 평가를 체계적으로 관리할 수 있습니다.
AI 분야에서 가장 똑똑한 친구들 몇 명이 제가 evals를 깊이 이해하지 못한다며 저를 '바보'라고 불렀습니다.
그래서... 저는 evals에 대해 아는 사람 중 가장 똑똑한 사람을 찾아내 그에게 가르침을 받았습니다.
@Vtrivedy10 (LangChain의 Labs 리드)은 38분간 진행된 모든 것들에 대한 마스터클래스를 통해 저를 쉬운 모드(easy mode)에서 신의 영역(god mode)으로 이끌어 주었습니다.
쉬운 모드: eval이란 무엇인가
정의: AI 에이전트가 작업을 올바르게 수행했는가?
두 가지 구성 요소가 필요합니다:
-
작업(Tasks). 확인 가능한 작업들입니다. 회의록 작성하기, 이메일 초안 작성하기, 적절한 Salesforce 테이블에서 Acme 찾기.
-
검증자(Verifiers). 작업을 수행한 후 옳고 그름을 판단할 수 있는 무언가입니다. 스크립트, 다른 모델, 명확한 체크리스트를 가진 사람일 수 있습니다.
어려운 모드: 환경(Environments)이란 무엇인가
정의: 에이전트가 작업을 수행하고 사용자가 그 성능을 평가할 수 있는 안전한 실습장입니다.
유의사항:
- 절대 프로덕션 환경에서 테스트하지 마세요. 에이전트는 여러분이 준 점수에 최적화하기 때문에 속임수를 쓸 것입니다.
- 엔지니어가 아니더라도 환경/evals를 실행할 수 있는 옵션들이 있습니다.
- Harbor (작업, 검증자, 샌드박스를 위한 오픈 소스 기본 요소)
- LangSmith Engine (GitHub에 살지 않아도 좋고 vs bad를 판단할 수 있는 사람들을 위한 UI).
- 공개된 Harbor 형식의 eval을 가져와 Claude Code나 Codex에게 설명해 달라고 요청한 다음, 여러분의 에이전트에 맞게 수정하세요.
신의 영역: 자기 개선 루프(self-improving loop)란 무엇인가
정의: 에이전트를 실제 환경에서 실행하여 → 그 프로덕션 동작을 evals/환경으로 변환하고 → 실패가 발생하지 않도록 에이전트를 수정하며 → 반복하는 것입니다.
유의사항:
- 먼저 트레이싱(tracing) 기능을 켜세요. 트레이스 = 모든 행동에 대한 영수증입니다 (도구 호출, Salesforce 핑, 웹 검색, 막다른 길).
- 이 로그들을 어딘가에 저장하세요 (대규모에서는 LangSmith를 사용하거나, 소규모에서는
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Agentic Workflow의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기