NVIDIA와 MIT 연구진, Karpathy의 방법론을 활용해 Agent harness 비용 2배 절감 - 15페이지 PDF 공개
요약
NVIDIA와 MIT 연구진은 Karpathy의 방법론을 활용하여 AI 에이전트(Agent) 개발 비용을 획기적으로 절감하는 방법을 제시했습니다. 기존 프롬프트 엔지니어링 방식 대신 체계적인 워크플로우 개선을 통해 API 비용과 토큰 사용량을 대폭 줄였습니다. 주요 개선 사항으로는 행동 융합, 완료된 단계 압축, 거대 출력 재생 중단 등이 있으며, 이를 통해 Codex 및 Claude Code 대비 낮은 비용으로 높은 성능을 유지했습니다.
핵심 포인트
- Karpathy 방법론 적용으로 에이전트 개발 비용을 2배 절감 가능합니다.
- 프롬프트 엔지니어링 대신 체계적인 워크플로우 개선에 초점을 맞췄습니다.
- 행동 융합, 단계 압축 등 여러 기술적 최적화가 핵심입니다.
- Codex 및 Claude Code 대비 낮은 API 비용으로 높은 효율성을 입증했습니다.
NVIDIA와 MIT 연구진이 Karpathy의 방법론을 사용하여 Agent harness 비용을 2배로 절감했습니다. (15페이지 PDF 공개)
패러다임 변화: 프롬프트 엔지니어링(prompt engineering) 대신 하나의 공식으로 대체되었습니다. 동일한 LLM, 동일한 벤치마크를 사용하지만, harness만 변경했습니다.
구축 과정은 다음과 같습니다:
1단계 → 에이전트의 실행 로그(execution logs) 검사: 반복되는 행동, 증가하는 컨텍스트, 과도하게 큰 출력 등에서 토큰이 작업을 진행시키는 데 쓰이지 않는 지점을 찾습니다.
2단계 → harness에 Karpathy의 루프를 실행: 제안(propose) → 구현(implement) → 검토(review) → 테스트(test) → 유지 또는 폐기(keep or discard). 검색을 시작하기 전에 품질 및 효율성 게이트를 수정합니다.
네 가지 개선 사항이 살아남았습니다:
3단계 → 행동 융합(fuse actions): 파일을 편집하고 계획된 테스트를 하나의 도구 호출(tool call)에서 실행합니다. 이 과정에서 모델 간의 왕복(model round trip)을 제거합니다.
4단계 → 완료된 단계 압축(compact at completed steps): 캐시된 컨텍스트를 재작성하는 비용보다 예상 절감액이 클 때만 수행합니다.
5단계 → 거대한 출력 재생 중단(stop replaying huge outputs): 출력을 아카이브하고, 두 번 전송한 후 핸들(handle)과 짧은 발췌본(short excerpt)을 유지합니다. 필요할 때 정확한 페이지를 검색하여 가져옵니다.
6단계 → 로그 읽기 위임(delegate log reading): 더 저렴한 모델에게 위임합니다. 이 모델이 원본 로그와 증거를 검증합니다. 검증에 실패하면 전체 로그를 반환합니다.
자신의 에이전트에 이를 적용하는 방법:
7단계 → Pi에서 코드가 실행되는 하나의 메커니즘부터 시작합니다. 모든 네 가지를 결합하기 전에 현재 설정과 비교하여 측정해봅니다.
8단계 → 변경 사항을 동결(freeze)하고, 보지 못한 작업에 대해 테스트합니다. 완료율, API 비용, 토큰을 함께 추적합니다. 실패하더라도 더 저렴한 실패는 여전히 실패입니다.
결과:
EdgeBench에서 네이티브 Codex 및 Claude Code 대비 50-54% 낮은 API 비용을 달성했습니다. (동일한 주력 LLM 사용)
Pi와 비교했을 때: 약 3분의 1 저렴하며, 토큰은 45-49% 적고, 평균 점수의 약 94%를 유지합니다.
이 15페이지 PDF를 북마크하고, 아래 기사에서 전체 워크플로우를 구축하세요. ↓
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기