
규모가 커질수록 BM25가 승리한다
요약
RAG 시스템의 규모에 따른 검색 성능 변화를 분석한 연구 결과입니다. 데이터 규모가 작을 때는 에이전트 기반 검색이 유리하지만, 약 1,000만 토큰을 기점으로 BM25와 같은 어휘 검색 방식이 성능 면에서 우위를 점합니다.
핵심 포인트
- 데이터 규모에 따른 검색 방식의 성능 교차 지점 존재
- 소규모 코퍼스에서는 에이전트 기반 검색이 효과적
- 1,000만 토큰 이상의 대규모 데이터에서는 BM25가 압도적 성능 발휘
BM25 wins at scale
RAG 패러다임에 대한 스케일링 연구(scaling study)는 교차 지점(crossover)을 보여줍니다: 에이전트 기반 검색(agentic search)은 작은 코퍼스(corpora)에서 앞서지만, 어휘 검색(lexical retrieval, BM25)은 약 1,000만(10M) 토큰 부근에서 추월하며 더 큰 규모에서는 압도적인 성능을 보입니다. https://t.co/aCTIN5dPUr
AI 자동 생성 콘텐츠
본 콘텐츠는 X @huggingpapers (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기