과학 시설을 위한 교정 에이전트 기반 하이브리드 RAG 및 운영 기반 평가
요약
과학 시설의 방대한 운영 지식을 활용하기 위해 교정 에이전트 기반의 하이브리드 RAG 시스템인 APS-RAG를 제안합니다. 밀집·희소 검색과 지식 그래프를 결합하고 MCP 기반의 ReAct 실행기를 사용하여 정보 재현율을 높였습니다.
핵심 포인트
- 밀집, 희소, 지식 그래프 채널을 결합한 하이브리드 검색 방식 적용
- 교정 에이전트 루프와 MCP 툴링 레이어를 통한 성능 최적화
- 평가를 위한 전용 데이터셋 APS-Bench 및 6계층 평가 하네스 구축
- 교차 인코더 재순위화기가 답변 품질 향상에 핵심적인 역할 수행
과학 사용자 시설(Scientific user facilities)은 전자 로그북, 기술 문서, 내부 위키, 운영 채팅 메시지, 유지보수 기록, 실시간 제어 시스템 데이터 등 단일 검색 인덱스로는 모두 커버할 수 없는 수십 년간의 운영 지식을 축적해 왔습니다. 우리는 Advanced Photon Source (APS)의 기관 지식을 자연어 질의를 통해 직원들이 접근할 수 있도록 하는 배포된 플랫폼인 APS-RAG (Advanced Photon Source Retrieval Augmented Generation)와 운영 기반 평가를 제시합니다. 검색 엔진은 밀집(dense), 희소(sparse), 지식 그래프 (Knowledge-Graph, KG) 채널을 질의 유형 적응형 상호 순위 융합(query-type-adaptive reciprocal-rank fusion)과 결합하고, 교정 에이전트 루프(corrective agentic loop)를 추가하며, Model Context Protocol (MCP) 툴링 레이어 상에서 네이티브 도구 ReAct 실행기(ReAct executor)를 실행합니다. 우리는 감사 가능한 정답(gold answers)을 포함한 50개 문항의 질의응답 (Question-Answering, QA) 데이터셋인 APS-Bench를 구축했습니다. 모든 검색 증강(retrieval-augmented) 변형 모델은 단순한 BM25 베이스라인(63.8%)보다 엄격한 핵심 정보 재현율(strict vital-nugget recall)을 수치적으로 개선했으며, 전체 교정 에이전트 GraphRAG는 70.3%의 점수를 기록했습니다. 교차 인코더 재순위화기(cross-encoder reranker)는 답변 품질에 크게 기여합니다. 이를 제거하고 LLM이 관련성을 점수화하도록 허용하면 엄격한 핵심 정보 재현율이 32.8% 급격히 감소합니다. 그래프 채널과 교정 루프는 예상대로 긍정적인 기여를 하지만, 성능 향상은 미미합니다. 또한, 최종 답변 합성에서 오픈 소스 및 폐쇄형(closed-source) LLM의 성능을 비교합니다. 우리는 다른 시설에서의 재현과 채택을 지원하기 위해 APS-Bench 구축 방법론, 6계층 평가 하네스(evaluation harness), 기반 코드베이스와 함께 '/aps-rag' 검색 에이전트 스킬 프레임워크를 공개합니다. 배포된 플랫폼과 운영 기반 평가는 시설 운영에서 신뢰할 수 있고 통계적으로 근거 있는 AI 지원을 위한 유망한 워크플로우를 제시하며, 이는 다른 대형 과학 장비로도 전이 가능합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기