평가 게이트 내부: 더 저렴한 모델이 작업을 인수하도록 결정하는 방법
요약
Operant는 '게이트' 메커니즘을 통해 반복 작업을 더 저렴한 모델로 이동시키는 방법을 설명합니다. 이 시스템은 학습된 기술(learned skill)을 사용하여 보류 작업(hold-out work)으로 성능을 평가하고, 심사관(judge)의 점수를 받아 사람이 승인하는 과정을 거칩니다.
핵심 포인트
- Operant는 게이트를 통해 반복 작업을 저비용 모델로 이동시킵니다.
- 학습된 기술은 보류 세트(hold-out set)를 사용하여 객관적으로 평가됩니다.
- 새로운 규칙은 그림자 상태(shadow state)에서 시작하여 트래픽 변경 없이 테스트됩니다.
- 게이트는 가장 비용이 많이 드는 대화부터 처리하며, 점수 산정에 사용됩니다.
저는 Operant를 만들었기 때문에 편향이 있습니다. 이 게시물은 원래 저희 블로그에 올라갔습니다. 여기에 올린 이유는 방법에 대한 비판을 받고 싶어서입니다. 제 질문들은 마지막에 적었습니다.
Operant는 반복되는 작업을 더 저렴한 모델로 이동시킬 수 있습니다. 이는 게이트를 통해서만 작동합니다. 이 게이트는 학습된 기술(learned skill)을 사용하여 보류된 작업(held-out work)을 재현합니다. 심사관(judge)은 그 결과를 사용자의 과거 답변과 비교하여 점수를 매깁니다. 그런 다음 사람이 변경 사항을 승인합니다.
이 게시물에서는 게이트의 각 단계를 설명합니다. 스크린샷들은 라이브 콘솔에서 가져온 것입니다. 데모 작업 공간의 샘플 값을 보여줍니다.
학습된 규칙은 그림자 상태(shadow)로 시작한다
Cortex는 목표별로 대화들을 패턴으로 그룹화합니다. Scribe는 그 패턴에 대한 기술을 학습합니다. 그런 다음 Operant는 학습된 규칙을 제안합니다: 이 패턴은 이 대상 모델과 이 기술 버전으로 이동해야 합니다.
새로운 학습된 규칙은 그림자 상태에서 시작합니다. 그림자 상태에서는 규칙이 트래픽을 변경하지 않습니다. 게이트가 존재하는 유일한 단계는 그림자 상태에서 활성(active) 상태로의 전환입니다.
게이트는 보류된 작업으로 점수를 매긴다
Scribe가 파일을 작성하기 전에, 패턴의 일부를 학습 세트(learn set)와 보류 세트(holdout set)로 분할하여 저장합니다. 기본적으로 대화의 4분의 1이 보류 세트로 들어갑니다. 기술은 오직 학습 세트로부터만 학습합니다.
게이트는 이 보류 세트를 사용하여 기술에 점수를 매깁니다. 절대로 그 기술을 가르친 대화로는 점수를 매기지 않습니다. 라우팅은 해당 트래픽 부분을 유지해야 하므로, 가장 비용이 많이 드는 대화부터 처리합니다. 기본적으로 한 번의 실행(run)은 최대 5개의 대화를 사용합니다.
일부 패턴은 캡처된 텍스트가 너무 적습니다. 이런 경우, 게이트는 목표 요약(goal summaries)으로부터 한 번의 작업(one-turn tasks)을 만듭니다. 그리고 이 점수들을 합성(synthetic)으로 표시하여 더 약한 증거를 볼 수 있게 합니다.
자체 기준선(Baseline) 대비 재현 (Replay against your own baseline)
세트의 각 대화에 대해 게이트는 사용자 턴을 두 번 재현합니다:
- 기준선(baseline) 아트는 해당 대화에서 가장 많이 사용된 모델을 사용합니다.
- 후보(candidate) 아트는 스킬이 적용된 대상 모델을 사용합니다.
기준선은 각 대화에서 가져옵니다. 따라서 게이트는 후보를 고정된 모델과 비교하는 것이 아니라, 여러분의 에이전트가 수행한 것과 비교합니다.
심사관(Judge)이 목표 달성 점수 부여
LLM 심사관은 동일한 사용자 턴에 대해 두 가지 답변 세트를 읽습니다. 그리고 패리티 점수(parity score)를 부여합니다:
| 패리티 | 의미 |
|---|---|
| 1.0 | 후보가 기준선만큼 잘했거나, 더 잘했습니다. |
| ... |
심사관은 목표 달성도, 정확성, 완전성을 점수화합니다. 스타일이나 길이는 점수화하지 않습니다. 또한 그 이유를 설명하는 문장 하나를 작성합니다. 기본 심사관 모델은 claude-opus-4-8이며, 콘솔에 각 규칙마다 표시됩니다.
게이트는 평균 패리티가 0.8 이상일 때 통과합니다. 이것이 기본 기준입니다. 콘솔에는 규칙별 결과가 표시되며, 예를 들어 "Gate 95%"와 같습니다.
사람이 승인 (Ratify)
통과한 게이트는 트래픽을 이동시키지 않습니다. 사람이 해당 규칙을 승인해야 합니다. 그 후에야 이 규칙은 패턴을 대상 모델로 전송하고, 스킬은 라우팅되는 모든 호출의 시스템 프롬프트에 포함됩니다.
패턴의 분석에는 또한 이 경로가 표시됩니다. 패턴이 학습된 스킬을 가지고 있을 때, 해당 내용은 다음과 같이 나타납니다: "스킬 승인, 평가 게이트 실행, 그리고 경로 승인(ratify the route)."
변경 사항 발생 시, 게이트 재실행
게이트는 세 가지 항목의 한 세트를 승인합니다: 대상 모델, 스킬 버전, 그리고 압축 설정입니다. 이 중 하나라도 수정하면 Operant가 보고서를 초기화(clears the report)합니다. 그러면 규칙을 승인하기 전에 게이트를 다시 실행해야 합니다.
활성 규칙은 대상 모델을 변경할 수 없습니다. 먼저 이를 섀도우(shadow)로 강등시킨 후, 편집하고 게이트를 다시 실행해야 합니다.
원클릭으로 강등 (Demote in one click)
버튼 "Demote to shadow"는 패턴을 이전에 사용했던 모델로 즉시 되돌립니다. Demote에는 게이트가 없습니다. 의심스러울 경우, 한 번의 클릭으로 변경을 중지할 수 있습니다.
게이트 이전 단계에 대해서는 How Scribe learns a skill from your own traces를 읽어보세요. 심사관(judge)에 대해서는 Can a small decision model grade an agent's outcome?를 읽어보세요.
제 질문들
저는 이 게이트에 대한 여러분의 비평을 받고 싶습니다:
질문 1: 평균 패리티(mean parity)가 0.8이 적절한 기준인가요? 아니면 각 대화가 개별적으로 통과해야 하나요?
질문 2: 기준선(baseline)은 각 대화가 가장 많이 사용했던 모델입니다. 이것이 좋은 참고 자료인가요, 아니면 자체 오류를 숨기고 있나요?
질문 3: 기본 실행(default run)은 5개의 대화를 사용합니다. 결과를 신뢰하기 위해 몇 개가 필요할까요?
답변을 댓글로 작성해 주세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기