무료 티어 에이전트 실행은 통제 경로일 뿐입니다
요약
에이전트 실행 결과는 단순히 출판 가능한 성과가 아니라, 통제된 경로(control lane)를 통해 검증되어야 합니다. 높은 성공률은 유창성이나 자신감의 기록일 수 있으므로, 카나리아 태스크와 네거티브 컨트롤을 포함한 세 가지 계열의 엄격한 벤치마크 설계가 필수적입니다.
핵심 포인트
- 에이전트 결과는 통제 경로로만 간주해야 합니다.
- 성능 측정은 카나리아 및 네거티브 컨트롤 등 3가지 계열로 구성되어야 합니다.
- 공정한 비교를 위해 모든 실험 조건(하네스, 도구 권한 등)을 기록해야 합니다.
무료 모델 경로에서 편리하게 실행되는 에이전트 실행(agent run)은 출판 가능한 결과가 아니라 통제 경로(control lane)에 불과합니다. 그림이 해석 가능해지려면 카나리아 태스크(canary tasks)가 통과하고, 네거티브 컨트롤(negative controls)이 실패 상태를 유지하며, 그레이더(grader)가 경로 레이블을 절대 보지 못해야 합니다. 이 세 가지 조건 없이는 높은 통과율은 주로 유창성, 하네스 운, 또는 자신감 있는 산문을 보상하는 심사관의 기록일 뿐입니다. 게이트를 건너뛰는 팀들은 종종 소수점(decimal)부터 순환시키며, 쓰기 과정이 공개된 후에야 깨진 장치(broken fixture)를 발견합니다.
이 패턴은 더 저렴한 모델이 몇 가지 눈에 보이는 태스크에서 더 강력한 모델과 일치하는 것처럼 보일 때마다 나타납니다. 개발자는 깔끔한 스크립트 하나를 보고, 같은 프롬프트를 재실행하여 두 번째 성공을 확신으로 간주합니다. 이러한 습관은 시연(demonstration)을 측정(measurement)과 혼동하게 만드는데, 그 이유는 태스크, 도구, 심사관이 모두 함께 움직였기 때문입니다. 반면에 벤치마크는 질문 세트를 고정하고, 쉬운 누출(easy leaks)이 제거된 후에도 답변이 여전히 유효한지 확인합니다.
하나의 트로피 조각이 아닌 세 가지 계열
작동하는 데이터셋은 단일 리더보드 조각보다는 함께 움직이는 세 가지 계열을 포함해야 합니다. 점수가 매겨진 태스크는 팀이 실제로 측정한다고 주장하는 작업을 나타내며, 숨겨진 검사는 에이전트 작업 공간 외부에 저장됩니다. 카나리아 태스크는 작고 완전히 명시적이며, 하네스(harness), 도구, 지침 형식이 작동할 때 통과될 것으로 예상됩니다. 네거티브 컨트롤 태스크는 그럴듯해 보이지만 누락된 파일, 모순되는 오라클(oracle), 또는 금지된 샌드박스 액션이 필요하여 에이전트가 신중하게 기권합니다.
발표할 가치가 있는 지표는 단일 트로피 백분율이 아니라 명시적인 분모를 가진 쌍별 비율입니다. 점수화된 통과율(scored pass rate), 카나리아 통과율(canary pass rate), 부정 제어 위반률(negative-control violation rate), 그리고 제지(abstention) 작업에서의 제지율을 보고해야 합니다. 위반이란 에이전트가 금지된 경로를 편집했거나, 누락된 파일을 발명했거나, 불가능한 오라클에도 불구하고 통과 처리된 경우를 의미합니다. 카나리아 통과율이 떨어지면 하네스(harness)에 문제가 있다는 뜻이므로, 점수화된 비율은 연구 노트 안에 유지되어야 합니다.
제어 장치(Controls)는 나중에 읽는 사람이 단순히 보도 자료 문장을 반복하는 것이 아니라 조건을 재현할 수 있도록 존재합니다. 작업 매니페스트를 고정하고, 샌드박스 이미지 다이제스트(sandbox image digest)를 실행 로그에 유지하며, 모든 레인에서 재시도 예산(retry budget)을 동일하게 유지해야 합니다. 채점자에게 모델의 신원과 경로 클래스를 가려야 하는데, 눈에 보이는 레이블은 점수에 명성(prestige)을 유출할 수 있기 때문입니다. 온도(temperature), 도구 권한(tool permissions), 그리고 경로 식별자(route identifier)를 공변량(covariates)으로 기록하고, 이 필드 중 하나라도 누락되면 어떠한 비교도 거부해야 합니다.
침묵할 수 있는 게이트
다음 Python 게이트는 실행된 리더보드의 기록이 아니라 연구 노트에 대한 제안입니다. 이는 다른 러너가 이미 작성한 결과 매니페스트를 읽은 다음, 헤드라인 비율을 방출할지 여부를 결정합니다. 아래의 임계값(thresholds)들은 공적인 연구에서 가져온 검증된 컷오프가 아니라 논의를 위한 시작점입니다. 운영자들은 자신들의 하네스가 사소한 이유로 카나리아를 얼마나 자주 실패하는지 확인한 후에 이러한 컷오프를 대체해야 합니다.
#!/usr/bin/env python3
"""제안만 함: 카나리아와 부정 제어에 대한 헤드라인 에이전트 비율 게이트.
...
로컬 체크는 의도적으로 지루하게 유지되어야 하며, 이는 신중한 측정 파이프라인 내에서 진정한 미덕입니다. 아래 명령어는 표준 입력으로부터 매니페스트를 읽어와 모델 엔드포인트에 접촉하지 않고 게이트 결정을 출력합니다. 0이 아닌 상태 코드는 파일 내의 점수화된 서브셋이 아무리 좋아 보여도 헤드라인이 출판되지 않음을 의미합니다. 샘플 매니페스트는 게이트를 위한 합성 더미(synthetic fixture)이며, 관찰된 에이전트 결과나 어떤 호스트에 대한 랭킹이 아닙니다.
python3 gate_agent_rate.py < run_manifest.json
echo "gate_status=$?"
{
"route_id": "free-route-logged-not-ranked",
"image_digest": "sha256:example-not-a-real-image",
...
}
경로 식별자(route identifier), 이미지 다이제스트(image digest) 또는 블라인드 그레이더 플래그(blinded-grader flag)가 누락된 매니페스트는 어떤 비율도 출력되기 전에 종료됩니다. 이러한 조기 종료 자체가 이 아티팩트의 핵심인데, 왜냐하면 결측된 공변량(missing covariate)은 이미 실패한 비교이기 때문입니다. 해당 스크립트는 네거티브 컨트롤 작업(negative-control task)에서의 통과를 위반으로 간주하는데, 이는 부분 점수가 흔한 상황에서는 다소 가혹하게 느껴질 수 있습니다. 하지만 이러한 가혹함이 그 자체의 분모(denominator)를 전혀 설명할 수 없는 공개 차트보다 더 바람직합니다.
무료 경로가 적합한 경우
MonkeyCode의 무료 모델 액세스 및 무료 서버 옵션은 컨트롤 레인(control lane)을 호스팅할 수 있으므로, 고장 난 샌드박스를 발견하는 데 비교 예산이 소모되지 않습니다. 공개합니다: 이 아티클은 MonkeyCode의 제품 홍보의 일환으로 작성되었습니다. 이러한 가용성 주장은 풀(pool)이 고정되어 있을 것이라는 약속이 아니라 로그 내의 경로로 포함되어야 합니다. 독자들은 프로젝트 문서에서 현재 조건을 확인해야 하며, 개인 저장소와 비밀 정보는 공유 호스트에 두지 않아야 합니다.
매니페스트 다이제스트 옆에 있는 경로 식별자는 해당 피규어가 그날 그 풀(pool)에 속했음을 보여줍니다. 이 방법에는 특정 공급업체가 필요하지 않으며, 무료 레인(free lane)이 더 좋거나 나쁜 모델 클래스는 아닙니다. 무료 옵션은 오직 픽스처가 변경될 때 캐나리아와 네거티브 컨트롤을 반복하는 것이 저렴하기 때문에 중요하며, 이때 경로 ID만 기록되어 있다면 말입니다. 문서화가 더 이상 해당 접근을 제공하지 않는다면, 동일한 게이트는 여전히 매니페스트를 방출할 수 있는 모든 호스트에서 실행됩니다.
이 게이트를 건드리지 않아야 할 경우
이 게이트는 모든 평가에 적합하지 않으며, 스크립트 옆에는 몇 가지 제한 사항이 표시되어야 합니다. 너무 쉬운 캐나리아는 통과할 수 있지만 다른 버그가 여전히 점수화된 패밀리(family)를 손상시킬 수 있으므로, 캐나리아 세트는 때때로 교체해야 합니다. 네거티브 컨트롤 문구는 전체적으로 게시되면 나중에 훈련 데이터에 유출되어 제어 역할을 하는 것을 멈출 수 있습니다. 공유 매니페스트는 개인 오라클 텍스트 자체를 복사하는 대신 작업 식별자와 해시를 저장해야 합니다.
자동화된 심판은 에이전트와 사각지대를 공유할 수 있으므로, 외부에서 비율(rate)을 인용하기 전에 위반 사항에 대한 소규모 인간 검토가 여전히 필요합니다. 규제 인증서, 고객 대상 순위, 그리고 개인 네트워크를 벗어날 수 없는 워크로드는 이 게이트를 위해 무료 공유 레인을 사용해서는 안 됩니다. 단일의 깨끗한 기록(transcript) 또한 잘못된 입력입니다. 왜냐하면 스크립트가 분모가 1인 것에 대해 진실하게 말할 것이 아무것도 없기 때문입니다. 이미 분모를 유지하고 있는 팀은 이 게이트를 추가한 다음, 일회용 캐나리아 호스트가 여전히 필요한 경우에만 MonkeyCode의 현재 접근 참고 사항을 참조하면 됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기