에이전트의 실제 검색 방식을 측정하는 웹 검색 벤치마크, ATLAS를 구축했습니다.
요약
본 글은 에이전트가 실제 웹에서 검색하는 방식을 측정하기 위해 ATLAS라는 새로운 웹 검색 벤치마크를 구축했다고 소개합니다. 기존의 벤치마크들이 포화되거나 부정확하다는 문제점을 지적하며, ATLAS는 강력한 검색 능력을 평가하는 데 초점을 맞춥니다.
핵심 포인트
- ATLAS는 에이전트의 실제 웹 검색 방식을 측정하는 새로운 벤치마크입니다.
- 기존 벤치마크들은 포화되거나 부정확하여 신뢰도가 떨어집니다.
- ATLAS는 강력한 검색 능력을 평가하며, 답변을 암기하는 것을 방지합니다.
- 실제 세계의 트렌드를 반영한 합성적 질문으로 구성되어 있습니다.
저희는 에이전트가 오늘날 실제로 어떻게 검색하는지를 위한 웹 검색 벤치마크인 ATLAS를 구축했습니다.
기존의 에이전트 기반 검색 벤치마크들은 종종 구식이거나, 오염되었거나, 포화 상태입니다. ATLAS는 강력한 검색과 약한 검색을 분리하도록 설계되었습니다.
더 알아보기:
https://exa.ai/blog/atlas-benchmark
기존의 평가(evals)들은 이미 포화 상태가 되었습니다. 선도적인 검색 에이전트들이 BrowseComp에서는 93%, DeepSearchQA에서는 95%의 점수를 기록합니다.
그리고 에이전트들은 답변을 암기하게 되었습니다:
ATLAS는 기존 검색 벤치마크보다 훨씬 더 검색의 가치를 반영합니다.
검색 결과를 의도적으로 에이전트에게 전달하지 못하게 할 때, ATLAS 질문들은 답하기가 어려워집니다.
ATLAS 과제들은 신선하거나 니치한 정보를 검색하기 위해 많은 소스를 필요로 합니다.
질문들은 실제 세계의 검색 트렌드를 기반으로 하는 자동화된 파이프라인을 통해 합성적으로 생성되었으며, 20개 이상의 주제 카테고리를 다룹니다.
최상위 검색 에이전트들조차 최고 노력 모드(highest effort modes)로 설정해도 검증된 정보의 1/3을 찾지 못합니다.
전체 연구 읽기:
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기