Google의 FRAMES 데이터셋에서 18가지 RAG 파이프라인을 에이전트 루프와 비교하여 벤치마킹한 결과
요약
본 기사는 FRAMES 데이터셋을 사용하여 다양한 RAG 파이프라인과 에이전트 루프를 비교 분석한 결과를 다룹니다. 하이브리드 검색, 재순위 지정 등 여러 요소를 테스트하여, 에이전트 루프가 전통적인 RAG 방식보다 월등히 높은 성능(92.7%)을 보였음을 입증했습니다. 특히 재순위 지정기의 효과는 기대와 달리 미미하거나 오히려 부정적이었습니다.
핵심 포인트
- 에이전트 루프가 전통적 RAG 대비 압도적으로 높은 정확도를 기록함 (92.7%).
- 재순위 지정기(reranker)의 성능 개선 효과는 크지 않거나 오히려 하락시킬 수 있음.
- RAG 시스템은 검색된 문서 기반으로 답변해야 하며, 모델 자체 기억에 의존하는 것은 지양해야 함.
하이브리드 검색(Hybrid search), 재순위 지정(reranking), 질의 분해(query decomposition), 그리고 질의 확장(query expansion)은 좋은 RAG에 필수적인 요소로 자주 다루어집니다. 그래서 저희는 각각이 실제로 얼마나 도움이 되는지 알아보기 위해 테스트를 진행했습니다. 모든 824개의 멀티홉 질문(multi-hop questions)을 포함하는 FRAMES 데이터셋에서 동일한 모델, 동일한 임베딩, 동일한 문서를 사용했습니다. 저희는 총 18가지 파이프라인 변형을 구축했습니다. 그중 가장 좋은 성능의 파이프라인은 78.9%를 기록했습니다. 검색 도구를 사용하여 결과를 읽고 다시 검색할 수 있는 저희 에이전트 루프(agent loop)는 92.7%를 기록했는데, 이는 모델에게 올바른 문서를 미리 제공하는 것과 거의 비슷한 수준입니다. 재순위 지정기(reranker)의 결과는 놀라실 수도 있습니다. 작은 재순위 지정기는 저희 최고 파이프라인의 정확도를 9 퍼센트 포인트 하락시켰고, 더 큰 재순위 지정기는 거의 도움이 되지 않았습니다. 저는 이미 재순위 지정을 통해 크게 개선되지 않을 것이라고 의심했지만, 이 가설을 테스트하고 싶었습니다. 또 다른 점은 다음과 같습니다. 모델이 명시적으로 검색된 문서에만 근거하도록 지시했음에도 불구하고 때때로 기억 속의 정보를 채워 넣는 경우가 있다는 것입니다. 그런 답변들조차 인용(citation)으로 가득할 수 있습니다. 저희는 결국 모든 정답을 시스템이 실제로 읽은 내용과 비교하여 확인했습니다. 관심 있으시면 여기에서 자세한 내용을 확인하실 수 있습니다: Agentic RAG vs. traditional RAG on FRAMES
전체 공개 정보: 저는 오픈 소스인 PipesHub에서 작업하고 있습니다. 벤치마크 코드와 실행 매뉴얼(runbook)은 다음 리포지토리에 있습니다: https://github.com/pipeshub-ai/pipeshub-ai/tree/frames
숫자가 무엇을 의미하는지에 대한 간략한 설명: 이 수치는 검색 점수(retrieval scores)가 아니라 최종 답변 정확도(end-to-end answer accuracy)입니다. 모든 답변은 LLM 심사위원(Claude Sonnet 5)이 FRAMES 논문 자체의 채점 프롬프트를 사용하여 평가했으며, 두 번째 심사위원(Gemini Flash 3.8)이 독립적으로 평가했습니다. 두 심사위원은 거의 모든 답변에 대해 동의했습니다 (Cohen's κ 0.93–0.98). 또한 시스템이 실제로 보여준 텍스트와 각 정답을 비교했기 때문에, 모델의 기억에서 나온 답변은 검색 성공으로 간주되지 않습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기