
HANDBOOK.md: 긴 컨텍스트의 에이전트 지시 이행을 위한 벤치마크
요약
긴 컨텍스트의 지침(SOP)을 준수하며 업무를 수행하는 에이전트의 능력을 평가하기 위한 새로운 벤치마크 HANDBOOK.md를 소개합니다. 65개의 작업과 20~124페이지 분량의 정책 문서를 통해 에이전트가 장기적인 도구 사용 과정에서 규칙을 얼마나 잘 지키는지 측정합니다.
핵심 포인트
- 긴 컨텍스트 내 상시 지침(SOP) 준수 여부를 테스트하는 벤치마크 제시
- Model Context Protocol 기반의 다양한 가상 회사 환경 제공
- 금융, 의료, 물류 등 5개 도메인과 10개 가상 회사 포함
- 프런티어 모델들도 긴 지침 준수에서 낮은 통과율을 보임
컴퓨터 과학 (Computer Science) > 인공지능 (Artificial Intelligence)
제목: HANDBOOK.md: 긴 컨텍스트의 에이전트 지시 이행을 위한 벤치마크
PDF HTML 보기 (실험적) 초록: 언어 모델 에이전트 (Language-model agents)는 시스템 프롬프트, 정책 파일, 또는 기술 문서와 같은 상시 지침(standing instructions) 하에 점점 더 많이 배포되고 있습니다. 즉, 컨텍스트에 이러한 지침을 배치하고 에이전트가 이후의 모든 행동을 해당 지침에 따라 수행할 것이라고 신뢰하는 방식입니다. 기존의 벤치마크들은 이러한 배포 패턴을 직접적으로 테스트하는 경우가 드뭅니다. 기존 방식은 에이전트가 작업을 완료할 수 있는지를 측정할 뿐, 길고 구속력 있는 정책 문서가 확장된 도구 사용 범위(tool-use horizon) 동안 실제로 에이전트의 행동을 제약하는지를 측정하지는 않습니다. 우리는 기업 직원이 회사 핸드북을 따르는 방식을 모델링한 65개의 에이전트 작업 벤치마크인 HANDBOOK.md를 제시합니다. 각 작업은 에이전트를 독립된 회사 환경, 즉 Model Context Protocol을 통해 노출된 모의 이메일, 채팅, 캘린더, 이슈 트래킹 및 커머스 서비스와 함께 파일 워크스페이스가 포함된 환경에 배치하며, 전문가가 작성한 20~124페이지 분량의 표준 운영 절차 (Standard Operating Procedure, SOP)에 따라 일상적인 전문 업무를 수행하도록 지시합니다. 작업은 5개 도메인(금융, 의료 청구, 보험, 물류, 인사)과 10개의 가상 회사를 아우릅니다. 암기를 방지하기 위해, 모든 작업은 10개의 기본 핸드북 중 하나를 수정하여 채점 기준이 되는 특정 규칙과 임계값을 변경하므로, 어떤 두 작업도 동일한 정책을 공유하지 않습니다. 채점은 완전히 결정론적(deterministic)입니다. 각 작업은 필요한 행동이 발생했는지와 금지된 행동이 발생하지 않았는지를 모두 확인하는 프로그래밍 방식의 기준(총 824개) 루브릭을 포함합니다. 모든 기준이 충족되어야만 통과되는 엄격한 채점 방식 하에서, 평가된 30개의 모델 구성 중 최상위 모델은 테스트의 36.2%를 통과했으며, 대부분의 프런티어 (frontier) 구성은 25% 미만에 머물렀습니다. 실패는 일관된 패턴을 보입니다: 에이전트가 환경 내의 그럴듯한 요청이 상시 정책을 무시하도록 허용하거나, 필수 확인 절차를 수행한 후 그 결과에 반하는 행동을 하거나, 긴 시간 범위(long horizons) 동안 규칙 세부 사항을 놓치거나, 달성하지 못한 준수 사항을 준수했다고 보고하는 등의 양상을 보입니다.
저희는 모든 태스크(tasks), 환경(environments), 그리고 평가 하네스(evaluation harness)를 공개합니다.
참고 문헌 및 인용 도구
이 기사와 관련된 코드, 데이터 및 미디어
데모 (Demos)
추천 및 검색 도구
arXivLabs: 커뮤니티 협력자와 함께하는 실험적 프로젝트
arXivLabs는 협력자들이 저희 웹사이트에서 직접 새로운 arXiv 기능을 개발하고 공유할 수 있도록 지원하는 프레임워크입니다.
arXivLabs와 함께하는 개인 및 조직은 모두 개방성, 커뮤니티, 탁월함, 그리고 사용자 데이터 프라이버시라는 저희의 가치를 수용하고 받아들였습니다. arXiv는 이러한 가치에 전념하고 있으며, 이를 준수하는 파트너와만 협력합니다.
arXiv 커뮤니티에 가치를 더할 프로젝트 아이디어가 있으신가요? arXivLabs에 대해 자세히 알아보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기