에이전트에게 인터넷 시야를 제공하는 레포지토리가 75,000개 스타를 기록했습니다.
요약
Agent-Reach와 같은 에이전트 레포지토리가 75k 스타를 기록하며 웹 데이터 접근의 수요가 높음을 보여줍니다. 기존 방식은 페이지 로드마다 LLM을 호출하여 비용과 지연 시간이 과도하게 발생합니다. 따라서, CSS 셀렉터를 한 번 생성하고 이를 결정론적으로 재사용하는 DeepScrape 같은 아키텍처가 효율적입니다.
핵심 포인트
- 에이전트에게 웹 데이터 접근(X, Reddit 등)의 수요가 높습니다.
- 페이지 로드마다 LLM을 호출하는 방식은 비용과 지연 시간이 과도합니다.
- CSS 셀렉터를 한 번 생성하고 결정론적으로 재사용하여 효율성을 높여야 합니다.
- DeepScrape는 Playwright와 LLM 기반 셀렉터, 구조화된 엔드포인트를 결합했습니다.
liam은 이번 주 GitHub에서 가장 빠르게 성장하는 AI 에이전트 레포지토리 5개를 분석했습니다. 그중 하나인 Agent-Reach는 에이전트가 X, Reddit, YouTube, GitHub를 읽고 검색할 수 있게 하면서 75k 스타를 돌파했습니다. 수요는 확실합니다: 에이전트는 웹 데이터에 대한 구조화된 접근이 필요하며, 현재 파이프라인 상태는 매우 어렵습니다.
제가 프로덕션 에이전트 배포에서 계속 보는 문제는 다음과 같습니다: 스크래핑 도구를 사용하려고 하면, 필요한 것을 추출하기 위해 페이지 로드마다 LLM을 호출합니다. 실제 볼륨에서는 토큰 비용과 지연 시간이 이를 사용할 수 없게 만듭니다. 일반적인 추출 프롬프트로 10,000페이지를 처리하면 실행당 수백만 개의 토큰이 발생합니다.
실제로 작동하는 방식은 다음과 같습니다: LLM을 사용하여 CSS 셀렉터를 한 번 생성하고, 이를 저장한 다음, 이후 모든 로드에서 결정론적으로 실행합니다. 페이지 구조가 변경될 때만 셀렉터를 다시 생성하면 됩니다. LLM 호출은 페이지당이 아니라 셀렉터 패턴당 한 번 이루어집니다.
이것이 바로 DeepScrape의 아키텍처입니다. 브라우저 자동화를 위한 Playwright, 페이지 변경 시 스스로 복구되는 LLM 생성 셀렉터, 다중 형식 출력(markdown, HTML, 스크린샷, PDF, 변경 추적), 그리고 여러분의 스크래퍼를 Claude와 Cursor 내부에서 타입이 지정된 도구로 노출하는 MCP 서버가 있습니다. 에이전트는 원시 HTML을 다시 읽는 대신 구조화된 엔드포인트를 호출합니다.
만약 웹 데이터 기반으로 구축하고 토큰 비용 장벽에 부딪혔다면, 오픈 소스입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X AI 사용법/팁의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기