
OpenAI의 웹 검색 기능이 포함된 API는 너무 비싼가요? 주입되는 토큰의 약 87%가 불필요하다는 것을 측정했습니다
요약
OpenAI의 웹 검색 API 사용 시 발생하는 과도한 토큰 비용 문제를 해결하기 위해 로컬 기반의 무료 웹 검색 파이프라인을 제안합니다. 문장 단위 압축과 의미론적 캐싱을 통해 정확도는 유지하면서 토큰 사용량을 87% 절감할 수 있음을 입증했습니다.
핵심 포인트
- OpenAI 웹 검색 API는 검색 결과로 인해 불필요한 토큰을 대량 소비함
- 로컬 파이프라인 구축 시 정확도(96%)를 유지하며 토큰 87% 절감 가능
- 문장 단위 압축만으로 재현율 손실 없이 토큰 사용량을 절반으로 감소
- 의미론적 캐싱을 통해 반복되는 검색 쿼리에 대한 비용을 무료로 처리 가능
OpenAI는 웹 검색 1,000회당 10달러를 부과하며, 각 검색은 결과물로 약 17k(17,000) 토큰을 컨텍스트(context)에 밀어 넣고 사용자는 이에 대한 추론(inference) 비용을 지불해야 합니다. 검색을 빈번하게 수행하는 에이전트 루프(agent loops)의 경우, 검색 도구가 모델 자체보다 더 큰 비용 항목이 될 수 있습니다. 저는 모델 번호별로 정밀 도구를 검색하여 정확도/용량을 확인하는 에이전트를 사용할 때 이 문제에 계속 직면했습니다. 높은 비용 때문에 저는 저만의 로컬(local) 기반 무료 웹 검색 파이프라인을 실험하게 되었습니다. 이 시스템은 RRF 융합(RRF fusion)을 이용한 멀티 엔진 검색, 로컬 페이지 페칭(fetching), cross-encoder 리랭커(reranker)를 결합한 하이브리드 BM25 + 임베딩(embedding) 검색, 그리고 문장 단위 압축(sentence-level compression)을 수행합니다. 또한 비용을 더욱 절감하기 위해 캐싱(caching) 기능(정확한 검색 쿼리 및 의미론적 검색 쿼리 모두 포함)을 추가했습니다. OpenAI의 자체 검색 벤치마크인 SimpleQA의 하위 집합에서 테스트를 진행했습니다. 다른 분들의 의견이 궁금합니다: 에이전트가 주입된 검색 컨텍스트를 실제로 얼마나 사용하는지 측정해 보신 분이 계신가요?
- 정확도는 호스팅된 검색(hosted search)과 동일하게 유지(96%)되면서 토큰은 87% 적게 사용했습니다. 호스팅된 검색이 주입하는 내용의 대부분은 답변에 기여하지 않습니다.
- 문장 단위 압축(Sentence-level compression)만으로도 측정된 재현율(recall) 손실 없이 결과 토큰을 절반으로 줄였습니다.
- 의미론적 캐싱(Semantic caching)은 호스팅된 도구에서 크게 누락된 부분입니다. 의역된 쿼리(예: “TypeScript 5.9에 무엇이 추가되었나” vs “TypeScript 5.9 새로운 기능”)는 임베딩(embeddings)으로 매칭하고 NLI 모델로 검증할 수 있어, 단어가 바뀐 반복 질문을 무료로 처리할 수 있습니다. 어떤 프런티어(frontier) 호스팅 API도 이를 수행하지 않습니다.
- 매 검색마다 대략 15k 이상의 토큰이 쏟아지기 때문에, 빈번하게 검색하는 에이전트를 실행할 때 비용 절감 효과가 매우 큽니다. 단 16번의 검색을 수행한 작은 테스트 루프에서도 약 1.50달러의 피할 수 있었던 지출이 나타났습니다. (첨부 이미지)
코드를 확인하고 싶거나 평가 보고서를 읽고 싶은 분은 다음을 참조하세요: https://github.com/firish/webfetch
/u/Remote-Breadfruit204가 r/OpenAI에 제출함 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기