OpenAI가 자사의 에이전트 하네스(agent harness) 비용을 저렴하게 유지하기 위해 발표한 5가지 규칙
요약
OpenAI가 에이전트 하네스 운영 비용을 절감하기 위해 발표한 5가지 설계 규칙을 소개합니다. 지연된 발견, 토큰 제한, 컨텍스트 추가 방식 등을 통해 캐시 적중률을 높이고 효율적인 에이전트 환경을 구축하는 방법을 다룹니다.
핵심 포인트
- 지연된 발견(deferred discovery)을 통한 초기 로드 비용 절감
- 도구 출력 토큰 제한 및 추가 전용(append-only) 컨텍스트 관리
- 프롬프트 접두사 일관성 유지를 통한 캐시 적중률 극대화
- 에이전트 설정 최적화를 위한 5가지 체크리스트 제공
OpenAI는 자사의 에이전트 하네스 (agent harness) 비용을 저렴하게 유지하는 5가지 규칙을 방금 발표했습니다:
- 지연된 발견 (deferred discovery): MCP 도구, 기술(skills) 및 플러그인(plugins)이 시작 시점에 모두 로드되지 않습니다. 모델은 그것들이 필요할 때만 이를 확인합니다.
- 도구 출력(tool output)은 기본적으로 10,000 토큰으로 제한됩니다. 모델은 다른 제한 값을 요청해야 합니다.
- 모델이 볼 수 있는 모든 것은 오직 추가(append only) 방식입니다. 새로운 메시지, 도구 결과 및 환경 업데이트는 끝에 추가되며, 이전 컨텍스트(context)로 다시 들어가지 않습니다.
- 도구들은 고정된 순서로 제시됩니다.
- 승인 정책(approval policy)과 같은 런타임 설정(runtime settings)은 도구 정의(tool definitions)에 작성되는 대신 실행 시점에 적용됩니다.
마지막 세 가지 규칙은 모두 프롬프트 접두사(prompt prefix)를 바이트 단위로 동일하게(byte for byte identical) 유지하며, 이것이 캐시 적중률(cache hit rate)을 높게 유지하는 비결입니다. 그들은 Codex와 ChatGPT 작업의 높은 캐시 적중률이 이러한 설계 덕분이라고 밝히고 있습니다.
자신의 설정을 확인하고 싶다면, 사용하는 어떤 에이전트든 여기에 붙여넣으세요. 모든 에이전트에서 작동합니다:
이 프로젝트의 에이전트 설정(agent config)을 읽으세요. 여기에는 MCP 설정, 기술(skills), 플러그인(plugins), 훅(hooks) 및 규칙(rules) 파일이 포함됩니다. 이 다섯 가지 기준에 따라 하나씩 판단하세요. 결과는 각각 별도로 유지하세요:
- 시작 시점에 얼마나 많은 도구와 기술이 로드되는지, 그리고 그중 이 프로젝트에서 한 번도 호출되지 않은 것은 무엇인지
- 도구 출력에 제한이 있는지. 어떤 도구가 가장 큰 페이로드(payload)를 반환했는지, 그리고 대략 몇 토큰인지
- 매 턴마다 현재 시간을 찍거나, 세션 중간에 규칙 파일을 다시 읽거나, 시스템 프롬프트(system prompt)를 즉석에서 수정하는 것처럼 이미 전송된 컨텍스트에 무언가를 다시 쓰거나 주입하는지
- 도구 목록이 두 번의 시작 시점에서 동일한 순서인지
- 권한 또는 승인 정책이 도구 설명에 작성되어 있는지
각 항목을 추적하세요: 통과(pass) 또는 실패(fail), 정확한 파일 또는 항목, 그리고 변경해야 할 한 가지 사항을 기록하세요. 찾을 수 없다면 찾을 수 없다고 말하세요. 지어내지 마세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: MCP의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기