OpenAI Web Search가 Artificial Analysis Search Index에서 74점으로 데뷔: Perplexity
요약
OpenAI Web Search가 새로운 통합 검색 기능을 선보이며, GPT-5.6 Luna 모델을 활용하여 단일 Responses API 호출 내에서 전체 검색 루프를 실행할 수 있게 되었습니다. 이 기능은 기존의 외부 API 호출 방식보다 효율적이며, 비용 및 성능 면에서 여러 경쟁사 대비 우수한 벤치마크 결과를 보여주었습니다.
핵심 포인트
- OpenAI Web Search는 단일 Responses API 호출로 통합 검색 기능을 제공합니다.
- Artificial Analysis Search Index에서 74점을 기록하며 높은 성능을 입증했습니다.
- 작업당 비용이 낮고, 토큰 사용량 및 모델 비용 효율성이 뛰어납니다.
- 도메인 필터를 통해 알려진 오염 출처를 차단하는 기능이 추가되었습니다.
OpenAI Web Search는 당사 보드에서 처음으로 통합된 퍼스트파티(first-party) 검색 도구입니다. 이전에는 에이전트가 Stirrup harness 내에서 Search API를 호출하는 방식이었다면, 이제 GPT-5.6 Luna (medium reasoning)이 OpenAI의 내장 web_search 도구를 호출하며, OpenAI가 전체 검색 루프를 하나의 Responses API 호출 내에서 실행합니다. 모든 설정은 동일한 기본 모델인 GPT-5.6 Luna (medium reasoning)을 사용합니다.
OpenAI Web Search는 작업당 약 $0.05의 비용으로, Parallel (advanced, $0.06)과 Perplexity (medium, $0.07)보다 저렴하지만, Octen ($0.024)보다는 약 두 배 비쌉니다. 다만, Octen이 3점 더 높은 점수를 기록했습니다.
OpenAI Web Search의 주요 벤치마킹 결과 (medium 검색 컨텍스트):
➤ Artificial Analysis Search Index에서 5번째 최적의 제공업체: OpenAI Web Search는 74점을 기록하여, 검색을 사용하지 않은 동일 모델(33점) 대비 41점 상승했습니다. 이 점수로 26개 제품 중 7위에 위치하며, You . com (highlights), Nimble (standard), Exa (auto)와 동률인 74점에 해당합니다. 이는 Perplexity의 세 가지 변형(77점에서 80점), Octen(77점), Parallel (advanced) 및 Brave (LLM context)가 기록한 75점보다 낮은 수치입니다.
➤ OpenAI Web Search는 당사의 독자적인 사실 답변 벤치마크인 AA-Omniscience에서 72%의 정확도를 달성하며 가장 뛰어난 성능을 보였습니다. 이는 26개 검색 제공업체 변형 중 3위에 해당하며, 선두 주자인 Firecrawl(73%)과 1점 차이입니다. 여러 검색에 걸친 다단계 추론(multi-hop reasoning)이 필요한 BrowseComp가 가장 취약한 벤치마크였으며, 여기서 73.5%를 기록하여 Perplexity 변형 및 Octen(85%~87%)보다 낮은 13위에 올랐습니다.
➤ OpenAI Web Search는 동일한 작업을 수행하는 데 더 적은 토큰을 사용합니다: OpenAI는 검색 결과를 포함하여 작업당 약 40k의 입력 토큰을 청구하며, 이는 보드에서 가장 효율적인 Search API인 Perplexity (low)의 125k와 비교됩니다. 또한 모델 비용 측면에서도 작업당 약 $0.009로 보드 내에서 가장 낮은 수준 중 하나입니다.
➤ 내장 검색은 대부분의 Search API보다 작업당 비용이 적게 듭니다: 약 $0.05/작업으로, OpenAI Web Search는 보드에 있는 25개 Search API 제품 중 17개(중앙값 $0.067)보다 저렴하며, 여기에는 Parallel (고급, $0.06)과 Perplexity (중간, $0.07)가 포함됩니다. Octen은 절반 정도의 비용($0.024)이 들며 3점 더 높은 점수를 받았습니다.
주요 세부 정보:
➤ 설정: OpenAI의 web_search 도구와 search_context_size를 중간(medium)으로 설정한 GPT-5.6 Luna (중간 추론)을 Responses API 호출 하나로 사용합니다.
➤ 가격 책정: 웹_search 호출 1k당 $10이며, 여기에 검색 콘텐츠가 추가됩니다. 이는 OpenAI가 모델 입력 토큰으로 청구하는 항목입니다.
➤ 오염(Contamination): 도구의 도메인 필터를 통해 알려진 오염 출처를 차단합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기