DBA-Bench: LLM 기반 데이터베이스 운영 에이전트를 위한 프로덕션 충실도 벤치마크
요약
LLM 기반 데이터베이스 운영 에이전트의 성능을 실제 프로덕션 환경과 유사하게 평가하기 위한 벤치마크인 DBA-Bench를 제안합니다. PostgreSQL 환경에서 복잡한 장애 시나리오를 통해 에이전트의 진단 및 복구 능력을 측정합니다.
핵심 포인트
- 실제 운영 환경과의 격차를 해소하는 4가지 핵심 요소 식별
- PostgreSQL 기반의 활성 워크로드 및 다중 소스 관찰 환경 제공
- 7개 도메인, 106개 시나리오를 포함한 체계적인 평가 체계
- 인간 DBA(93.4%) 대비 자동화 에이전트(최대 17.9%)의 낮은 복구율 확인
LLM (Large Language Model) 기반 데이터베이스 에이전트는 유망한 가능성을 보여주고 있으나, 서로 다른 작업 범위, 테스트베드(testbeds), 그리고 지표들로 인해 비교가 어렵습니다. 우리는 평가와 실제 프로덕션 운영 사이의 네 가지 격차를 식별했습니다: 라이브 환경 충실도 (실행 중인 데이터베이스와의 멀티턴 읽기-쓰기 상호작용); 관찰 공간(observation-space)의 규모와 복잡성 (수천 개의 시계열, 비즈니스 로그, 동시 활동 전반에 걸친 인과적 진단); 솔루션 공간의 개방성 (서로 다른 운영 트레이드오프를 가진 다양한 복구 방법); 그리고 시나리오의 복잡성과 커버리지 (내부 메커니즘과 운영 도메인 전반에 걸쳐 연쇄적으로 발생하는 장애). 우리는 프로덕션 충실도, 결과 우선 평가(outcome-first evaluation), 그리고 제어된 시나리오 재현성을 통해 이러한 격차를 해결하는 벤치마크인 DBA-Bench를 제시합니다. 이 벤치마크는 활성 워크로드, 지속적인 상태, 그리고 다중 소스 관찰이 포함된 계측된 PostgreSQL 환경을 사용합니다; 성공 여부는 안전 제약 조건 하에서 측정 가능한 복구 또는 장애 제거로 정의됩니다; 그리고 각 실행 전에 시나리오별 체크를 포함한 스냅샷을 복원합니다. 이 벤치마크는 7개의 작업 도메인에 걸쳐 106개의 시나리오를 포함하며, 참조 경로의 진단 깊이와 환경 복잡성에 따라 두 가지 공개 난이도 레이블을 제공합니다. 우리는 6개의 파운데이션 모델(foundation-model) 시스템, 2개의 GPT-5.5 기반 데이터베이스 에이전트, 그리고 인간 DBA(Database Administrator) 참조를 포함하여 9개의 베이스라인 그룹을 평가합니다. 848회의 자동화된 실행 결과, 진단(Diagnosis), 결과(Outcome), 그리고 안전 통과(Safe Pass)율은 각각 32.7%, 19.6%, 12.4%를 기록했습니다. 가장 우수한 자동화된 베이스라인은 17.9%의 Safe Pass율을 기록한 반면, 인간 DBA 참조는 93.4%를 기록했습니다. 자동화된 Safe Pass율은 쉬운(Easy) 시나리오에서의 19.6%에서 어려운(Hard) 시나리오에서의 7.6%로 떨어지며, 안전한 엔드 투 엔드(end-to-end) 복구의 어려움을 강조합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기