
Hound Web MCP는 완전히 무료입니다: AI 에이전트에게 무료로 웹 기능(fetch + search + crawl)을 제공하는 도구
요약
Hound Web MCP는 AI 에이전트에게 무료로 웹 검색, fetch, 크롤링 기능을 제공하는 로컬 MCP 서버입니다. Cloudflare와 같은 안티 봇 시스템을 우회하는 스텔스 엔진과 API 키가 필요 없는 키리스(keyless) 검색 기능을 갖추고 있습니다.
핵심 포인트
- Cloudflare 및 안티 봇 시스템을 우회하는 2단계 fetch 방식 제공
- API 키나 유료 계정 없이 DuckDuckGo, Google 등 10개 백엔드 검색 가능
- 실제 Chrome 트래픽과 일치하는 TLS 핑거프린트 및 마우스 움직임 모사
- 로컬 ONNX cross-encoder를 활용한 신경망 기반 검색 결과 재순위화
제가 시도해 본 모든 MCP 웹 도구는 동일한 문제를 가지고 있었습니다. 에이전트가 fetch를 호출하면 Cloudflare 장벽에 부딪히고, 포기하거나 에러 페이지의 HTML 때문에 환각 (hallucination) 현상을 일으킵니다. 검색 (Search)을 하려면 유료 API 키를 연결해야 합니다. 크롤링 (Crawling)을 하려면 또 다른 도구가 필요합니다. PDF는 뒷전이고요. 그리고 전체 스택이 컨텍스트 윈도우 (context window)에 앉아 있는 것만으로도 4,000~5,000개의 토큰을 태워버립니다. 저는 이 모든 것을 처리할 수 있는 하나의 로컬 MCP 서버를 원했습니다. 키도 없고, 계정도 없고, 제 쿼리를 클라우드를 통해 라우팅하는 제3자 스크래퍼 (scraper)도 없는 것 말이죠. 그래서 Hound를 만들었습니다. 현재 별(star) 512개를 기록하고 있으며, 방금 스텔스 엔진 (stealth engine)을 출시했기에 이곳에 공유합니다. 실제로 작동하는 안티 봇 (Anti-bot). 2단계 fetch 방식입니다. 먼저 일반 HTTP를 사용하는데, 이는 빠르고 웹의 90%는 브라우저가 필요하지 않기 때문입니다. 사이트가 HTTP를 차단하거나 JS 셸 (JS shell)을 제공하면, 자동으로 Patchright 안티 디텍트 브라우저 (anti-detect browser)로 격상됩니다. 에이전트는 단계를 선택하지 않습니다. 그저 콘텐츠를 돌려받을 뿐입니다. 스텔스 엔진이 가장 어려운 부분입니다. 포함된 내용은 다음과 같습니다: 실제 TLS 핑거프린트 (fingerprint)를 위한 시스템 Chrome 탐지 (JA4가 번들된 Chromium이 아닌 실제 Chrome 트래픽과 일치함), 플랫폼과 WebGL 렌더러가 GPU와 일치하는 (탐지기가 이를 교차 참조함) 4개의 일관된 핑거프린트 프로필, commit + evaluate를 통해 주입되는 JS 레이어 패치 (Patchright의 격리된 컨텍스트에서 작동하는 유일한 방법), 세션마다 다른 해시를 생성하는 getImageData 및 toDataURL에 대한 결정론적 노이즈 (deterministic noise)가 적용된 Canvas 노이즈, Cloudflare v9 행동 ML 스코어링을 위한 베지에 곡선 (Bezier curve) 마우스 움직임, 클릭 전 체크박스까지 인간과 유사한 마우스 경로를 사용하는 CF Turnstile 솔버 (solver). v11.1.0의 벤치마크 수치: 대상 / 보호 기능 / 결과
bot.sannysoft.com 탐지 스위트 / 모든 체크 통과
CanadianInsider / CF Turnstile (31개 사이트 중 가장 어려움) / 200 OK, 78 KB
Medium / CF interstitial / 200 OK, 93 KB
StackOverflow / CF / 200 OK, 1.1 MB
NowSecure / CF challenge / 200 OK, 180 KB
Glassdoor / DataDome / 200 OK, 849 KB
Canvas 노이즈는 세션당 서로 다른 해시를 생성합니다. 메모리 RSS는 연속적인 fetch 동안 평탄하게 유지됩니다 (브라우저 누수 없음).
키(key) 없이 수행하는 검색 — 10개의 키리스 (keyless) 백엔드를 병렬로 실행: DuckDuckGo, Brave, Mojeek, Yahoo, Yandex, Startpage, Google, Qwant, 그리고 선택 사항인 Wikipedia 및 Grokipedia. 로컬 ONNX cross-encoder를 활용한 신경망 재순위화 (Neural reranking). API 키, 계정, Serper 또는 Tavily 결제가 필요 없습니다. 결과에는 각 URL에 대해 얼마나 많은 독립적인 인덱스가 동의했는지를 보여주는 합의 점수 (consensus score)가 포함됩니다. 차단된 백엔드는 60초 동안 회로 차단 (circuit-broken)됩니다. 나머지 9개는 계속 서비스를 제공합니다. 검색은 결코 중단되지 않습니다.
내 에이전트 사용 방식을 바꾼 기능
Claude가 75페이지 분량의 PDF를 가져올 때, 컨텍스트 (context)에 75페이지 전체가 모두 필요하지는 않습니다. focus="embedding dimension" 옵션을 사용한 smart_fetch는 BM25와 관련된 문단만 반환합니다. 열 번 호출할 것을 한 번의 호출로 끝냅니다. 포스트 캐싱 (Post-cache)이 적용되어 재요청(re-fetch)이 필요 없습니다. 이것 하나만으로도 연구 작업을 위해 Claude Code를 사용하는 방식이 바뀌었습니다.
모든 응답에는 주석이 달립니다
시그널 (Signal) | 에이전트에게 알려주는 내용
content_ok | 실제 콘텐츠 또는 JS 셸 / 로그인 벽 / 에러 페이지
page_type | 기사, 리스트 페이지, 인증 벽, 페이월 (paywall), PDF
next_action | 다음에 수행할 정확한 작업 (링크 팔로우, 페이지 넘기기, 소스 전환)
content_age_days / is_stale | 현재 상태 질문에 대해 오래된 정보임을 표시
quality_score | PDF 추출 품질 0-1 (CID로 깨진 OCR 감지)
에이전트는 가공되지 않은 HTML에서 추측하는 대신 이러한 필드들을 기반으로 분기 (branch)합니다.
토큰 비용: 6개 도구 전체에 대해 2.7K 토큰. 저는 에이전트에게 최적의 사용법을 가르치기 위해 모든 도구 설명을 새로 작성했습니다. 의사결정 가이드, 응답 시그널 설명, 워크플로우 패턴 등이 포함됩니다. 이 가이드는 연결 시점의 블록이 아니라 도구 정의 (tool definitions) 내에 존재하므로, 컨텍스트 압축 (context compaction) 과정에서도 유지됩니다.
총 6개의 도구: fetch, search, crawl, screenshot, cache clear, version. 12개 도구로 비대해지는 낭비 없이, 모든 도구가 그 자리를 가질 만한 가치가 있습니다.
정직한 한계
인터랙티브 챌린지가 포함된 DataDome, Akamai, 그리고 일부 Cloudflare Turnstile 설정은 여전히 이를 차단할 것입니다. 응답은 에이전트에게 콘텐츠를 가져온 척하는 대신 소스를 전환하라고 알려줍니다. Google Search는 429 에러를 반환합니다 (Cloudflare가 아닌 자체 봇 탐지). 나머지 9개의 백엔드가 이를 보완합니다.
로그인이 필요한 사이트는 범위에서 제외됩니다 (Hound는 페이지 상호작용 (page interaction)을 수행하며, 인증된 세션 (authenticated sessions)을 다루지는 않습니다). 프록시 (proxy) 없이 지속적인 IP당 차단 (per-IP blocking)을 완벽하게 방어할 수 있는 키리스 (keyless) 로컬 도구는 없습니다. 프록시를 보유하고 있다면 HOUND_SEARCH_PROXY를 사용할 수 있습니다.
설치 방법:
pip install hound-mcp[all] && playwright install chromium
명령어:
hound -u # hound 업데이트
--doctor 옵션으로 상태 확인 (health check)
hound --rollback # 마지막 업데이트 취소
GitHub: https://github.com/dondai1234/master-fetch (마음에 드신다면 리포지토리에 별 (Star)을 눌러주세요 😄 )
웹사이트: https://hound-mcp.pages.dev
MIT 라이선스, 376개의 테스트 완료. 직접 사용해 보신다면 무엇이 작동하지 않는지 알려주세요. 특히 스텔스 브라우저 (stealth browser)를 사용했음에도 여전히 차단되는 사이트에 대해 매우 궁금합니다.
submitted by /u/Opening_Library9560 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/ClaudeAI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기